AI

[AI 논문 리뷰] 인공지능 연구실 회고 (2) - Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward

dayoung20 2026. 8. 22. 22:50

이번에 리뷰할 논문의 제목은 Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward 이다. 2025년 NAACL 논문으로 64회의 인용수를 가지고 있다.

 

이 논문을 한 문장으로 이해해보자면 "영상의 내용을 자세히 설명한 caption을 이용해서 LMM의 답변을 평가하고 좋은답변과 나쁜 답변을 만들어 DPO로 Video LMM을 학습시킨다" 이다. 전체적인 흐름을 살펴보면 영상 -> caption -> Reward -> Preference Pair -> DPO의 흐름이다. 

 

Contribution

이 논문의 핵심 contribution은 크게 3가지로 볼 수 있다. 

  • large-scale, detailed video caption dataset 생성
  • cost-effective method로 비디오의 instruction-following 평가
  • language model feedback을 reward로서 DPO를 video LMM에 적용

Pipeline

파이프라인은 논문에서 위의 피규어로 설명을 하고 있다. 비디오 -> caption 생성 -> SFT -> 여러 답변 생성 -> chatGPT 평가 -> DPO 순서이다. 

 

피규어의 위쪽을 보면 비디오를 frame sequence로 표현하고 있다. 이 프레임들을 하나의 sequence로 concatenate해서 video llm이 영상 전체를 볼 수 있도록 만든다. 그 후 비디오의 캡션을 생성한다. 영상 frame sequence와 prompt를 GPT-4V에 입력한다. 그리고 단순한 한 문장이 아니라 영상의 세부적인 내용을 포함한 caption을 생성하도록 한다. 이 떄 상세한 caption을 만드는 이유는 뒷 과정에서 chatGPT가 모델의 답변이 영상과 일치하는지 평가해야 하기 때문이다. 따라서 캡션을 영상의 textual evidence로 사용하는 것이다. 

 

이 피규어는 appendix에 있었던걸로 기억한다. chatgpt로 상세 캡션을 사용해서 instruction 데이터를 생성하는 것이다. 

 

SFT를 통해 Video LLM이 영상과 질문에 적절하게 답변하도록 학습한다. 학습된 모델에 영상과 질문을 입력해 여러 개의 답변을 생성하고, ChatGPT가 앞서 생성한 상세 캡션을 참고하여 각 답변이 영상의 내용과 일치하는지 평가한다. 이를 바탕으로 영상과 일치하는 답변을 chosen response, 부정확한 답변을 rejected response로 구성한다.

마지막으로 이 preference data를 활용해 DPO를 수행한다. 이를 통해 영상의 내용과 일치하는 답변은 더 선호하고, 사실과 다른 답변은 생성하지 않도록 모델을 학습시켜 factuality를 높이고 hallucination을 줄인다.

 

DPO with Feedback from Language Model as Reward

여기서는 크게 3가지로 설명할 수 있다. 

먼저 첫번째로, instruction pairs random sampling으로 SFT 모델이 각 입력당 6개의 답변을 생성한다.

두번째로, chatGPT가 캡션을 기반으로 각 답변을 평가한다. 1~5점 척도로 하고 explanation을 함께 제공한다.

마지막으로, reward 점수로 positive/negative를 구성한다. 

 

수식을 보면 이렇게 DPO 표현식으로 나타낼 수 있다.

 

assessing evaluator quality using captions in place of frames

이 실험은 영상 전체를 직접 보여준 GPT-4V의 평가와 영상의 캡션만 보여준 ChatGPT의 평가가 얼마나 비슷한지를 검증하고 있다. 이 실험의 결과를 보았을 때 75.33%는 chatGPT의 점수가 GPT-4V의 점수에서 1 표준편차 범위 안에 들어오는 비율을 나타낸다. 따라서 약 75.53%가 GPT-4V평가와 평가와 크게 벗어나지 않았다는 의미이다. 또한, 데이터셋 별로 ChatGPT와 GPT4V의 평가의 일치율을 비교했을 떄도 70% 이상이 일치한다. 

 

따라서 영상의 Frame을 직접 보지 않더라도, Detailed Video Caption을 이용하면 ChatGPT가 GPT-4V와 상당히 유사하게 답변의 factuality를 평가할 수 있다. 이 논문에서는 비용이 많이 드는 GPT-4V 평가 대신, 영상에서 미리 생성한 caption을 활용한 chatGPT 평가를 DPO의 evaluator로 사용할 수 있다고 보았다. 

 

Experiments

마무리로 실험 결과이다. Hound-dpo 방식을 사용하면 다른 베이스 대비 뚜렷한 성능 향상이 일어난 것을 볼 수 있다.

 

느낀점

영상 자체를 직접 평가하지 않고 상세 캡션을 활용해 저렴하게 평가하는 방법이 인상적이었다. 특히 ChatGPT의 캡션 기반 평가가 GPT-4V의 프레임 기반 평가와 70% 이상 일치한다는 점에서, 비용과 효율성을 고려하면서도 Video LLM의 hallucination을 줄일 수 있는 방법이라고 느꼈다.

 

특히 DPO 수식을 보았을 때 Video LLM에 맞는 DPO를 적용한 논문이라고 생각되어 흥미로웠다.