MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO

Benchmark Model Rank Results
image-generation-on-wiseMindOmni (w/ cot)#1Overall: 0.71Cultural: 0.75Time: 0.70Space: 0.76Biology: 0.76
image-generation-on-wiseMindOmni (w/o cot)#8Overall: 0.43Cultural: 0.40Time: 0.38Space: 0.62Biology: 0.36
text-to-image-generation-on-genevalMindOmni#3Overall: 0.83Single Obj.: 0.99Two Obj.: 0.94Color Attri.: 0.71