UniEvo-VL 연구, 모델의 자기 비평으로 이미지 생성 성능 개선
9월 30일 공개된 UniEvo-VL 논문은 하나의 멀티모달 모델이 교사·학생 역할을 나눠 자기 비평을 학습에 쓰는 방법을 제안했다. 연구진의 Qwen-image-2512 실험에서 GenEval 점수는 0.747에서 0.808로 올랐다. 다만 이미지 속 문자 생성에서는 개선 효과가 일관되지 않았다.
학생이 직접 생성한 샘플 경로에서 교사·학생의 확산 분포 차이를 줄이도록 학습한다.
GenEval2 Soft-TIFA 점수는 32.97에서 35.53으로 상승했다고 연구진이 보고했다.
더 강한 외부 비평 모델을 사용한 실험도 진행했으며, 연구진은 비평 능력이 자기 개선의 상한에 영향을 줄 수 있다고 해석했다.
교사에게만 비평 정보를 주고 학생은 원래 질문만 보게 해, 수정 과정에서 얻은 정보를 모델의 기본 생성 능력으로 옮기는 방식이다.
원문
- UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvementarxiv.org · 원문 2026-10-07