← Back to list

[ByteDance/Zhejiang Univ] Thinking with Programming Vision: Towards a Unified View for Thinking…

Background and Overview

YouShin kim · 2025-12-09 11:12 · 0 claps · 7.8 min read
#computer-vision #mllm #coderstool #reinforcement-learning #ai-research
Open on Medium ↗
Wiki topics: LLM · Large Language Models EDU · Education & Learning 💻 · Programming

[ByteDance/Zhejiang Univ] Thinking with Programming Vision: Towards a Unified View for Thinking with Images

Background and Overview

최근 멀티모달 대규모 언어 모델(MLLM) 분야에서는 모델이 이미지를 수동적으로 해석하는 것을 넘어, 도구(Tool)를 활용해 이미지를 능동적으로 조작하고 추론하는 “Thinking with Images” 개념이 주목받고 있습니다. OpenAI의 o3와 같은 최신 모델들이 이러한 접근 방식을 채택하고 있지만, 기존 연구들은 여전히 중요한 한계에 봉착해 있습니다. 대부분의 모델은 ‘자르기(Crop)’와 같은 매우 제한적인 도구 세트에 의존하며, 도구의 이름과 인자가 고정된 레지스트리 방식을 사용하기 때문에 확장성과 유연성이 부족합니다.

본 연구팀은 최신 SOTA(State-of-the-Art) 모델들조차 이미지가 회전되어 있거나 뒤집혀 있는 등의 단순한 물리적 변형에 대해 놀라울 정도로 취약하다는 사실을 발견했습니다. 인간에게는 매우 쉬운 90도 회전된 이미지 인식이나 거울 모드 셀카의 텍스트 판독이, 최신 AI 모델에게는 인식률을 최대 80%까지 떨어뜨리는 심각한 성능 저하를 유발합니다. 이는 단순히 시각 인코더의 문제를 넘어, 모델이 시각적 정보를 획득하기 위해 적절한 도구를 능동적으로 사용하지 못한다는 점을 시사합니다.

이러한 문제를 해결하기 위해 연구진은 “CodeVision”이라는 새로운 프레임워크를 제안했습니다. 이는 고정된 도구 목록을 사용하는 대신, 모델이 Python 코드를 직접 생성하여 이미지를 조작하는 “Code-as-Tool” 패러다임입니다. 이 방식은 모델이 사전에 정의되지 않은 도구라도 코드를 통해 즉석에서 구현하여 사용할 수 있게 하며, 런타임 피드백을 통해 오류를 수정하고 복잡한 다단계 추론을 가능하게 합니다.

Model-Specific Test Results

연구팀은 Qwen2.5-VL 및 Qwen3-VL 시리즈를 기반으로 CodeVision 모델을 학습시키고, GPT-5, Gemini 2.5 Pro, GPT-4o 등 현존하는 최고 성능의 모델들과 비교 실험을 진행했습니다.

  1. 이미지 방향 및 변형에 대한 강건성 (Robustness) 연구 결과, 기존 SOTA 모델들은 이미지가 회전되거나 반전되었을 때 성능이 급격히 하락했습니다. 예를 들어, 회전된 텍스트 인식 벤치마크에서 베이스라인 모델들은 처참한 결과를 보인 반면, CodeVision-7B 및 8B 모델은 베이스 모델 대비 17점 이상의 성능 향상을 기록하며 압도적인 격차를 보였습니다. 이는 모델이 코드를 통해 이미지를 올바른 방향으로 회전시킨 후 인식을 수행하는 ‘전략적 행동’을 학습했기 때문입니다.

  2. 다중 도구 사용 및 추론 능력 (Multi-Tool Reasoning) 단일 도구가 아닌 여러 도구를 복합적으로 사용해야 하는 시나리오에서 CodeVision의 진가가 드러났습니다. 새로운 벤치마크인 MVToolBench에서 CodeVision-7B는 60.1점을 기록하여, 32.6점을 기록한 Gemini 2.5 Pro를 거의 두 배 차이로 따돌렸습니다. 이는 단순한 도구 호출을 넘어, 문제 해결을 위해 어떤 순서로 도구를 조합해야 하는지를 정확히 파악하고 있음을 증명합니다.

  3. 창발적 도구 사용 (Emergent Tool Use) 가장 흥미로운 발견 중 하나는 모델이 학습 데이터에 포함되지 않은 도구들을 스스로 발견하고 사용했다는 점입니다. 강화 학습(RL) 과정에서 모델은 흐릿한 이미지의 텍스트를 읽기 위해 ‘대비(Contrast) 향상’, ‘그레이스케일 변환’, ‘선명도(Sharpness) 조절’ 등의 기능을 코드로 구현하여 사용했습니다. 이는 모델이 단순히 패턴을 암기하는 것이 아니라, 시각적 문제를 해결하기 위한 최적의 방법을 코딩을 통해 스스로 찾아낸다는 것을 의미합니다.

Test Datasets

본 연구의 신뢰성을 높이고 CodeVision의 성능을 검증하기 위해 연구진은 기존 데이터셋을 활용함과 동시에, 더욱 까다로운 조건을 가진 새로운 데이터셋과 벤치마크를 구축했습니다.

Cold-Start SFT 데이터: 다양한 도메인(필기체, OCR, 표/차트, 수학 등)에서 수집한 약 5,000개의 고품질 데이터로, 다중 턴 대화와 오류 복구 시나리오를 포함합니다. GPT-5를 활용하여 메타데이터 기반의 정교한 추론 과정을 생성했습니다.

강화 학습(RL) 데이터: 약 40,000개의 데이터로 구성되며, 난이도 필터링을 거쳐 모델의 전략적 개선이 필요한 샘플들로 엄선되었습니다. 각 샘플은 필수 사용 도구(Must-use tool)에 대한 메타데이터를 포함하여 모델이 올바른 도구 사용 습관을 기르도록 유도합니다.

MVToolBench: 기존 벤치마크들이 단일 도구(주로 자르기)에 집중하는 한계를 극복하기 위해 설계된 새로운 벤치마크입니다. 이미지 내 0.01% 이하의 아주 작은 텍스트를 인식하거나, 회전과 반전이 복합적으로 적용된 이미지를 처리해야 하는 등, 여러 도구를 순차적으로 사용해야만 해결할 수 있는 고난도 문제들로 구성되어 있습니다.

변형된 OCRBench 및 ChartQAPro: 기존의 정적인 벤치마크에 5가지 기하학적 변형(90/180/270도 회전, 수평/수직 뒤집기)을 적용하여 모델의 인식 및 추론 강건성을 극한으로 테스트했습니다.

Research Methodology and Conclusion

CodeVision의 핵심은 2단계 학습 파이프라인과 정교하게 설계된 밀집 보상(Dense Reward) 함수에 있습니다.

  1. 2단계 학습 방법론

1단계: Cold Start (SFT): 먼저 지도 미세 조정(SFT)을 통해 모델에게 기본적인 코드 작성 문법과 도구 사용 패턴을 학습시킵니다. 이 과정 없이는 강화 학습 단계에서 모델이 유의미한 정책을 탐색하지 못하고 실패한다는 것이 실험을 통해 증명되었습니다.

2단계: 강화 학습 (RL): GRPO(Group Relative Policy Optimization) 알고리즘을 사용하여 모델이 단순한 정답 맞히기를 넘어 ‘전략적’으로 사고하도록 훈련합니다.

  1. 밀집 프로세스 보상 함수 (Dense Process Reward) 단순히 최종 정답(Outcome)에만 보상을 주는 희소 보상(Sparse Reward) 방식은 모델의 학습을 불안정하게 만듭니다. 이를 해결하기 위해 연구진은 다음과 같은 복합 보상 체계를 도입했습니다.

전략 보상 (Strategy Reward): 필수 도구를 사용했는지, 혹은 선택적이지만 유용한 도구를 발견하여 사용했는지에 대해 보상합니다.

제약 패널티 (Constraint Penalty): 불필요하게 도구를 많이 사용하거나(효율성 저하), 이미지가 정상임에도 회전을 시도하는 등의 ‘보상 해킹(Reward Hacking)’ 행동에 대해 벌점을 부여합니다. 또한, ‘자르기’를 수행했으나 정답 영역과 겹치지 않는 등 잘못된 근거에 기반한 추론도 제재합니다.

결론 연구팀은 코드를 도구로 사용하는 접근 방식이 기존의 고정된 도구 사용 방식보다 월등히 뛰어난 유연성과 확장성을 제공함을 입증했습니다. CodeVision은 시각적 인지 과정을 프로그래밍 작업으로 전환함으로써, 모델이 스스로 시각적 증거를 확보하고, 오류를 수정하며, 새로운 도구를 창발적으로 사용하는 능력을 갖추게 했습니다. 이는 향후 MLLM이 단순한 관찰자를 넘어, 환경을 능동적으로 조작하고 문제를 해결하는 진정한 에이전트로 진화하는 데 중요한 기틀을 마련한 것입니다.

Implications

이 연구가 IT 개발 및 AI 산업에 시사하는 바는 매우 큽니다.

첫째, ‘Visual Agent’의 패러다임 전환입니다. 지금까지는 더 좋은 Vision Encoder를 만드는 데 집중했다면, 이제는 “어떻게 볼 것인가”를 코드로 제어하는 에이전트적 능력이 중요해졌습니다. 이는 저해상도 이미지나 손상된 이미지가 많은 실제 산업 현장(제조업 불량 검출, 문서 자동화 등)에서 AI의 실용성을 획기적으로 높일 수 있습니다.

둘째, 유지보수와 확장성의 혁신입니다. 새로운 시각적 기능이 필요할 때마다 모델을 재학습시키거나 도구 API를 새로 개발할 필요 없이, 모델이 스스로 Python 라이브러리(OpenCV, PIL 등)를 조합하여 기능을 구현할 수 있다는 점은 AI 파이프라인의 개발 비용을 획기적으로 절감해 줍니다.

마지막으로, 신뢰성 있는 AI(Reliable AI)로의 진전입니다. 모델이 자신의 코드가 실패했을 때 에러 로그를 읽고 스스로 디버깅하여 재시도하는 능력은, 예측 불가능한 엣지 케이스(Edge Case)가 많은 실제 서비스 환경에서 시스템의 안정성을 보장하는 핵심 기술이 될 것입니다. CodeVision은 AI가 단순히 정답을 뱉는 ‘블랙박스’가 아니라, 논리적인 절차(코드)를 통해 해답을 찾아가는 ‘투명한 파트너’가 될 수 있음을 보여줍니다.

References

[1] arXiv:2512.03746v1, “Thinking with Programming Vision: Towards a Unified View for Thinking with Images” [2] ByteDance BandAI CodeVision GitHub Repository (Referenced in paper)

Tags

ComputerVision #MLLM #CodeAsTool #ReinforcementLearning #AIResearch #ByteDance #컴퓨터비전 #멀티모달 #코드비전 #강화학습 #인공지능논문 #바이트댄스


메타데이터
post_id
dcf314dcc2ec
slug
bytedance-zhejiang-univ-thinking-with-programming-vision-towards-a-unified-view-for-thinking-dcf314dcc2ec
url
https://medium.com/@mdpman/bytedance-zhejiang-univ-thinking-with-programming-vision-towards-a-unified-view-for-thinking-dcf314dcc2ec
canonical_url
https://medium.com/@mdpman/bytedance-zhejiang-univ-thinking-with-programming-vision-towards-a-unified-view-for-thinking-dcf314dcc2ec
author_url
https://medium.com/@mdpman
status
ok
fetched_at
2026-06-20 20:29:01