AI 2

[AI 논문 리뷰] 인공지능 연구실 회고 (2) - Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward

이번에 리뷰할 논문의 제목은 Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward 이다. 2025년 NAACL 논문으로 64회의 인용수를 가지고 있다. 이 논문을 한 문장으로 이해해보자면 "영상의 내용을 자세히 설명한 caption을 이용해서 LMM의 답변을 평가하고 좋은답변과 나쁜 답변을 만들어 DPO로 Video LMM을 학습시킨다" 이다. 전체적인 흐름을 살펴보면 영상 -> caption -> Reward -> Preference Pair -> DPO의 흐름이다. Contribution이 논문의 핵심 contribution은 크게 3가지로 볼 수 있다. large-scale, detaile..

AI 2026.08.22

[AI 논문 리뷰] 인공지능 연구실 회고 (1) - Hallucination Augmented Contrastive Learning for Multimodal Large Language Model

지난 2025년 7월부터 2026년 2월까지 8개월간 인공지능 연구실에서 관련 논문을 읽고 연구를 진행해보았다. 그 과정에서 인상 깊게 읽었던 논문들을 정리하고 공유하고자 한다. 나는 주로 멀티모달에 관심을 가졌었고, 이미지-텍스트, 비디오-텍스트 모델의 할루시네이션 관련 논문을 읽었다. 먼저 첫번째로 리뷰할 논문은 Hallucination Augmented Contrastive Learning for Multimodal Large Language Model 이다. 해당 논문으로 세미나 발표도 했기 때문에 깊이있게 공부했던거 같다. 먼저 인용수만 보더라도 굉장히 많은 것을 볼 수 있다. 이 논문은 CVPR 2024에 채택된 논문으로, MLLM의 Hallucination 문제를 Representati..

AI 2026.08.19