← Back to list

[arXiv] — Watch Before You Answer: Learning from Visually Grounded Post-Training

비전-언어 모델(VLM)의 비디오 이해 성능은 급격히 발전하고 있으나, 본 논문은 이러한 발전의 상당 부분이 실제 시각적 이해가 아닌 **언어적 지름길(Linguistic Shortcutting)**에 의존하고 있다는 점을 지적합니다. 연구진은 이를…

YouShin kim · 2026-04-13 02:27 · 0 claps · 4.9 min read
#vlm #video-understanding #linguisticshortcutting #visual-grounding #rlhf
Open on Medium ↗
Wiki topics: FT · Fine-tuning & Adaptation LNG · Linguistics & Language EDU · Education & Learning

[arXiv] — Watch Before You Answer: Learning from Visually Grounded Post-Training

비전-언어 모델(VLM)의 비디오 이해 성능은 급격히 발전하고 있으나, 본 논문은 이러한 발전의 상당 부분이 실제 시각적 이해가 아닌 언어적 지름길(Linguistic Shortcutting)에 의존하고 있다는 점을 지적합니다. 연구진은 이를 해결하기 위해 시각적 정보 없이는 답변이 불가능한 질문만을 선별하여 학습하는 VIDGROUND 방법론을 제안합니다.

1. 배경 및 개요: 언어적 편향의 심각성

현재 널리 사용되는 비디오 이해 벤치마크(VideoMME, MMVU 등)의 40–60%는 비디오 입력 없이 텍스트 질문과 선택지만으로 정답을 맞힐 수 있는 것으로 나타났습니다. 이러한 현상은 모델이 시각적 특징을 학습하는 대신 기존의 언어적 사전 지식(Language Priors)에 의존하게 만들며, 모델 규모가 커질수록 시각적 이득(Visual Gain)은 정체되거나 오히려 감소하는 결과를 초래합니다.

본 연구는 이러한 문제를 해결하기 위해 사후 학습(Post-training) 단계에서 시각적 접지(Visual Grounding)가 반드시 필요한 데이터만을 큐레이션하여 학습 효율과 성능을 동시에 높이는 전략을 제시합니다.

2. 방법론 및 기술적 분석: VIDGROUND의 핵심 전략

VIDGROUND는 복잡한 알고리즘 변경보다는 데이터의 질을 근본적으로 개선하는 데 집중합니다.

2.1 텍스트 단독 답변 가능성(TA)의 4대 범주

연구진은 모델이 비디오를 보지 않고도 정답을 맞히는 메커니즘을 네 가지로 분류했습니다:

  1. 텍스트 지름길 및 언어적 단서: 질문 자체에 포함된 특정 단어가 정답을 암시하는 경우 (예: ‘장식된(decorated)’이라는 단어에서 ‘다채로워짐’을 유추).
  2. 외부(상식) 지식: 비디오 없이 상식만으로 답변 가능한 경우 (예: 절벽을 내려올 때 ‘로프’에 의존한다는 사실).
  3. 추론 및 소거 전략: 비논리적인 선택지를 제거하여 정답을 찾는 방식 (예: 기름을 싱크대가 아닌 ‘웍’에 붓는다는 상식적 판단).
  4. 상상된(환각된) 비디오 내용: 질문을 바탕으로 그럴듯한 시나리오를 생성하여 우연히 일치하는 경우 (예: 고양이 영상에서 ‘그루밍’을 하고 있을 것이라 추측).

2.2 데이터 큐레이션 파이프라인

  • 필터링: GPT-5-mini 모델을 사용하여 시각적 입력 없이 텍스트만으로 정답을 맞힐 수 있는 질문(TA)을 식별합니다.
  • 선별: 필터링 결과, 기존 Video-R1–260K 데이터셋의 약 69.1%(181,710개)만이 진정으로 시각적 이해를 요구하는 시각적 접지(VG) 데이터인 것으로 확인되었습니다.
  • 검증: 이러한 선별 방식은 다른 모델(Gemini-3.1-Pro 등)을 통한 교차 검증에서도 97% 이상의 일관된 결과를 보여 높은 신뢰성을 입증했습니다.

3. 시스템 아키텍처 및 학습 알고리즘

VIDGROUND는 기본 모델로 Qwen2.5-VL-7B-Instruct를 채택하고, 강화 학습 기반의 사후 학습을 수행합니다.

3.1 GRPO 기반 최적화

연구진은 Group Relative Policy Optimization (GRPO) 알고리즘을 사용하며, 비디오 이해에 특화된 시공간 인지 보상(Temporal-aware rewards)을 추가했습니다.

학습 목적 함수는 다음과 같습니다 :

4. 데이터 및 평가 프로토콜

4.1 주요 벤치마크 평가 결과

VIDGROUND는 적은 데이터(69.1%)를 사용하고도 전체 데이터셋을 사용한 모델보다 우수한 성능을 보였습니다.

4.2 프레임 확장성 (Frame Scaling)

일반적인 VLM은 프레임 수가 늘어나도 성능 향상이 미미하거나 오히려 하락하는 경우가 많으나, VIDGROUND는 프레임 수 증가에 따라 성능이 꾸준히 향상되는 가장 강력한 프레임 확장성을 보여주었습니다. 이는 모델이 언어적 지름길 대신 추가적인 시각 정보를 효과적으로 활용하게 되었음을 의미합니다.

5. 정성적 분석 및 추론 패턴 비교

추론 과정(Reasoning Chains) 분석 결과, 기존 모델인 Video-R1은 비디오 내용보다는 ‘추상적인 예술 개념’이나 ‘텍스트 기반 소거법’에 의존하는 경향이 강했습니다. 반면 VIDGROUND는 “비디오의 내용을 고려할 때…”와 같이 실제 관찰된 시각적 요소(선, 모양, 색상 등)를 체계적으로 언급하며 답변을 도출했습니다.

6. 시사점 및 결론

  • 성능의 허구: 현재 벤치마크 점수의 상당 부분은 시각 이해가 아닌 언어 모델링 능력의 향상을 반영하고 있습니다.
  • 효율적 학습: 무조건 많은 데이터를 학습하는 것보다, 언어적 편향이 제거된 ‘시각적으로 유의미한’ 데이터를 선별하는 것이 훨씬 효과적입니다.
  • 향후 과제: 비디오 이해 벤치마크는 최신 언어 모델을 활용하여 주기적으로 TA 질문을 필터링하고 품질을 점검해야 합니다.

VIDGROUND는 데이터 큐레이션만으로도 복잡한 알고리즘 개선 없이 VLM의 비디오 이해 능력을 근본적으로 강화할 수 있음을 입증했습니다.

References:

  1. **Watch Before You Answer: Learning from Visually Grounded Post-Training**

Tags:

VLM #VideoUnderstanding #LinguisticShortcutting #VisualGrounding #RLHF #DataCuration #비전언어모델 #비디오이해 #언어적지름길 #시각적접지 #데이터큐레이션 #강화학습


메타데이터
post_id
071a810b289a
slug
arxiv-watch-before-you-answer-learning-from-visually-grounded-post-training-071a810b289a
url
https://medium.com/@mdpman/arxiv-watch-before-you-answer-learning-from-visually-grounded-post-training-071a810b289a
canonical_url
https://medium.com/@mdpman/arxiv-watch-before-you-answer-learning-from-visually-grounded-post-training-071a810b289a
author_url
https://medium.com/@mdpman
status
ok
fetched_at
2026-07-22 23:18:53