| conditional-text-to-image-synthesis-on-coco-1 | Gligen (zero-shot) | #3 | instance success rate: 0.30mIoU: 0.27 |
| layout-to-image-generation-on-layoutbench-1 | GLIGEN | #2 | AP: 30.7 |
| layout-to-image-generation-on-layoutbench-2 | GLIGEN | #2 | AP: 38.9 |
| layout-to-image-generation-on-layoutbench-3 | GLIGEN | #2 | AP: 33.3 |
| layout-to-image-generation-on-layoutbench-4 | GLIGEN | #2 | AP: 36.3 |
| text-to-image-generation-on-coco | GLIGEN (fine-tuned, Detection + Caption data) | #3 | FID: 5.61 |
| text-to-image-generation-on-coco | GLIGEN (fine-tuned, Detection data only) | #4 | FID: 5.82 |
| text-to-image-generation-on-coco | GLIGEN (fine-tuned, Grounding data) | #7 | FID: 6.38 |