FG-CLIP 2: Fine-Grained Bilingual Vision–Language Understanding
FG-CLIP 2 advances fine-grained image–text alignment with dynamic-resolution training, a redesigned objective, and stronger Chinese data.
Dawei Leng, Chunyu Xie, and Bin Wang · 2025-11-06