이번에 리뷰할 논문의 제목은 Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward 이다. 2025년 NAACL 논문으로 64회의 인용수를 가지고 있다. 이 논문을 한 문장으로 이해해보자면 "영상의 내용을 자세히 설명한 caption을 이용해서 LMM의 답변을 평가하고 좋은답변과 나쁜 답변을 만들어 DPO로 Video LMM을 학습시킨다" 이다. 전체적인 흐름을 살펴보면 영상 -> caption -> Reward -> Preference Pair -> DPO의 흐름이다. Contribution이 논문의 핵심 contribution은 크게 3가지로 볼 수 있다. large-scale, detaile..