← Back to list

GR-3 Technical Report, GR-3 기술 보고서: 범용 로봇 제어를 위한 차세대 비전-언어-행동(VLA) 모델

배경 및 개요

YouShin kim · 2025-07-30 07:28 · 0 claps · 7.5 min read
#gr3 #robotics #vla-models #bytedance-ai
Open on Medium ↗

GR-3 Technical Report, GR-3 기술 보고서: 범용 로봇 제어를 위한 차세대 비전-언어-행동(VLA) 모델

배경 및 개요

  1. 배경: ‘범용 로봇’을 향한 오랜 꿈과 현실의 장벽

인간의 일상 작업을 돕는 ‘범용 로봇(Generalist Robot)’은 로봇 공학의 오랜 목표였습니다. 하지만 현실 세계는 예측 불가능한 물체, 환경, 지시로 가득 차 있어 로봇이 모든 상황에 유연하게 대처하기란 매우 어렵습니다. 최근 비전-언어-행동(Vision-Language-Action, VLA) 모델의 등장은 이러한 꿈에 한 걸음 다가갈 수 있는 길을 열었습니다. VLA 모델은 사전 훈련된 비전-언어 모델(VLM)에 행동 예측 능력을 결합하여, 자연어 지시를 이해하고 다양한 작업을 수행할 수 있습니다.

  1. 개요: ByteDance의 야심작, GR-3

이 기술 보고서는 ByteDance의 Seed 팀이 개발한 최신 대규모 VLA 모델, GR-3의 성과를 소개합니다. GR-3는 기존 VLA 모델의 한계를 극복하고, 더욱 인간에 가까운 범용 로봇을 구현하기 위해 설계되었습니다. 이 보고서의 핵심 메시지는, GR-3가 다음과 같은 세 가지 핵심 역량을 통해 기존 기술을 뛰어넘는 성과를 달성했다는 점입니다.

뛰어난 일반화 능력 (Generalization): 훈련 데이터에 없던 새로운 물체, 환경, 심지어 “가장 큰 물체를 상자에 넣어줘”와 같은 추상적인 개념이 포함된 지시까지 이해하고 수행합니다.

효율적인 적응 능력 (Efficient Adaptation): VR 장비를 통해 수집된 소량의 인간 행동 데이터(Human Trajectory Data)만으로도 새로운 작업에 빠르고 저렴하게 적응할 수 있습니다.

견고한 장기 과제 수행 능력 (Robust Long-Horizon Performance): 여러 단계에 걸친 복잡한 작업(예: 식탁 정리)이나 섬세한 조작(예: 옷 걸기)을 누적 오류 없이 안정적으로 수행합니다.

이러한 능력은 다각적인 훈련 레시피(Multi-faceted Training Recipe) 덕분에 가능했으며, 보고서는 GR-3와 함께 개발된 다재다능한 이족보행 로봇 ‘ByteMini’도 함께 소개합니다.

핵심 성능 및 결과

GR-3는 세 가지 핵심적인 실제 로봇 실험을 통해 그 우수성을 입증했습니다.

  1. 일반화된 집기 및 놓기 (Generalizable Pick-and-Place)

목표: 다양한 환경에서 처음 보는 물체와 추상적인 지시를 얼마나 잘 따르는지 평가.

실험 설정:

처음 보는 환경 (Unseen Environments): 훈련에 사용되지 않은 계산대, 회의실 등 4가지 새로운 환경에서 테스트.

처음 보는 지시 (Unseen Instructions): “왼쪽에 있는 콜라를 상자에 넣어줘”, “촉수가 달린 동물을 상자에 넣어줘” 등 크기, 위치, 상식 기반의 추상적 지시를 사용.

처음 보는 물체 (Unseen Objects): 훈련 데이터에 없던 45개의 새로운 물체(전체의 70% 이상이 새로운 카테고리)를 대상으로 테스트.

결과:

GR-3는 SOTA 베이스라인 모델(πο)을 모든 부문에서 큰 차이로 능가했습니다. 특히 ‘처음 보는 지시’에서 성공률을 40%에서 77.1%로, ‘처음 보는 물체’에서 40%에서 57.8%로 대폭 향상시켰습니다.

이는 웹 스케일 Vision-Language 데이터와의 공동 훈련(Co-Training)이 추상적 개념 이해에 결정적인 역할을 했음을 증명합니다.

또한, 단 10개의 인간 행동 데이터(Few-shot)만으로 ‘처음 보는 물체’에 대한 성공률을 57.8%에서 86.7%까지 끌어올려, 매우 높은 데이터 효율성을 보여주었습니다.

  1. 장기 과제: 식탁 정리 (Long-Horizon Table Bussing)

목표: “식탁을 치워줘”라는 단일하고 모호한 지시를 받고, 여러 단계(음식 포장 → 식기 정리 → 쓰레기 버리기)의 작업을 자율적으로 수행하는 능력 평가.

결과: GR-3는 베이스라인 모델보다 훨씬 높은 과제 진행률을 보였으며, 특히 세부적인 지시를 따르는 Instruction-Following 설정에서는 97.5%의 압도적인 성공률을 기록했습니다(베이스라인: 53.8%). 이는 GR-3가 장기적인 계획을 수립하고 중간 단계의 지시를 정확히 따르는 능력이 매우 견고함을 의미합니다.

  1. 섬세한 조작: 옷 걸기 (Dexterous Cloth Manipulation)

목표: 옷걸이를 집고, 변형되기 쉬운 옷을 옷걸이에 걸친 후, 건조대에 거는 복잡하고 섬세한 양손 조작 능력 평가.

결과: GR-3는 처음 보는 패턴과 소매 길이를 가진 옷에 대해서도 75.8%의 높은 과제 진행률을 달성하며, 베이스라인을 모든 조건에서 능가했습니다. 이는 변형 가능한 물체(deformable objects)를 다루는 섬세한 조작 능력에서도 뛰어남을 보여줍니다.

핵심 기술 및 훈련 방법론

GR-3의 강력한 성능은 ‘다각적인 훈련 레시피’와 진보된 모델 아키텍처에 기반합니다.

  1. 3가지 종류의 데이터 혼합 훈련 (Figure 4)

GR-3는 세 가지 이종 데이터를 함께 학습하여 각 데이터의 장점을 극대화합니다.

로봇 궤적 데이터 (Robot Trajectory Data): 로봇 원격 조종을 통해 수집된 기본적인 행동 데이터. (모방 학습의 기반)

웹 스케일 Vision-Language 데이터 (Vision-Language Data): 인터넷에서 수집한 방대한 양의 이미지-텍스트 쌍. GR-3가 추상적인 개념과 상식을 학습하는 핵심 원천입니다. 이 데이터와의 공동 훈련(Co-Training)이 일반화 능력의 핵심입니다.

인간 궤적 데이터 (Human Trajectory Data): VR 장비를 통해 효율적으로 수집된 인간의 손 움직임 데이터. 새로운 작업에 대한 Few-shot 적응에 사용됩니다.

  1. 모델 아키텍처 (Figure 3)

기본 구조: 사전 훈련된 VLM(Qwen2.5-VL-3B-Instruct)을 백본으로 사용하고, 행동 예측을 위해 Action Diffusion Transformer (DiT)를 결합한 Mixture-of-Transformers 구조를 채택했습니다.

핵심 기술:

Flow Matching: 행동 예측을 위한 생성 모델링 기법으로, 부드럽고 자연스러운 로봇 움직임을 생성합니다.

RMSNorm 추가: 훈련 안정성을 극적으로 향상시키기 위해 DiT 블록 내부에 추가적인 RMSNorm 레이어를 적용했습니다. 이는 지시 사항을 따르는 능력을 크게 향상시키는 결정적인 역할을 했습니다.

‘Task Status’ 보조 감독: “진행 중”, “종료”, “명령어 오류”와 같은 작업 상태를 예측하는 보조 작업을 추가하여, 모델이 언어 지시를 더 주의 깊게 보도록 강제했습니다.

  1. ByteMini 로봇 플랫폼

GR-3의 성능을 최대한 발휘하기 위해 특별히 설계된 22자유도(DoF)의 양팔 모바일 로봇입니다. 인간과 유사한 민첩성을 가진 7자유도 팔과 독특한 구형 손목 관절을 특징으로 하여, 좁은 공간에서도 섬세한 양손 조작이 가능하도록 설계되었습니다.

결론

GR-3는 ① 대규모 Vision-Language 데이터와의 공동 훈련, ② 효율적인 인간 데이터 기반 Few-shot 학습, 그리고 ③ 효과적인 모방 학습을 결합한 포괄적인 훈련 레시피를 통해, 범용 로봇 제어를 위한 VLA 모델의 새로운 지평을 열었습니다.

이 보고서는 실제 로봇을 이용한 광범위한 실험을 통해, GR-3가 추상적인 개념을 이해하고, 처음 보는 물체와 환경에 효과적으로 일반화하며, 인간의 최소한의 시연만으로 새로운 기술을 배우고, 복잡하고 긴 작업을 견고하게 수행할 수 있음을 성공적으로 입증했습니다. GR-3는 일상 생활에서 인간을 돕는 범용 로봇이라는 목표를 향한 중요한 발걸음입니다.

시사점

‘상식’의 주입: 로봇 지능의 핵심: GR-3의 성공은 로봇이 물리 세계의 행동만 배워서는 안 된다는 점을 명확히 보여줍니다. 웹 스케일의 Vision-Language 데이터를 통해 인간 세계의 ‘상식’과 ‘추상적 개념’을 학습하는 것이, 로봇이 진정으로 유연하고 지능적으로 행동하기 위한 필수 조건임을 증명했습니다.

데이터의 융합: 차세대 로봇 훈련 패러다임: 로봇 데이터, 웹 데이터, 인간 데이터를 모두 활용하는 ‘하이브리드 데이터’ 훈련 방식이 차세대 로봇 정책 학습의 표준이 될 가능성이 높습니다. 이는 데이터 수집의 병목 현상을 해결하고, 데이터 효율성을 극대화하는 강력한 전략입니다.

인간-로봇 협업의 가속화: VR 장비를 이용해 시간당 450개의 궤적을 수집하는 등, 인간이 로봇에게 새로운 기술을 가르치는 과정이 매우 빠르고 직관적으로 변하고 있습니다. 이는 로봇이 새로운 산업 현장이나 가정 환경에 훨씬 빠르게 적응할 수 있게 됨을 의미합니다.

하드웨어와 소프트웨어의 동반 진화: GR-3라는 강력한 AI 두뇌와, 그 능력을 물리적으로 구현할 수 있는 ByteMini라는 다재다능한 신체의 결합은, 로봇 공학의 발전이 소프트웨어와 하드웨어의 긴밀한 협력을 통해 이루어짐을 다시 한번 상기시킵니다.

GR3 #Robotics #VLAmodel #GeneralistRobot #AI #ByteDance

GR3 #로봇공학 #VLA모델 #범용로봇 #인공지능 #바이트댄스

출처 : https://www.arxiv.org/pdf/2507.15493


메타데이터
post_id
d5321e71bb18
slug
gr-3-technical-report-gr-3-기술-보고서-범용-로봇-제어를-위한-차세대-비전-언어-행동-vla-모델-d5321e71bb18
url
https://medium.com/@mdpman/gr-3-technical-report-gr-3-%EA%B8%B0%EC%88%A0-%EB%B3%B4%EA%B3%A0%EC%84%9C-%EB%B2%94%EC%9A%A9-%EB%A1%9C%EB%B4%87-%EC%A0%9C%EC%96%B4%EB%A5%BC-%EC%9C%84%ED%95%9C-%EC%B0%A8%EC%84%B8%EB%8C%80-%EB%B9%84%EC%A0%84-%EC%96%B8%EC%96%B4-%ED%96%89%EB%8F%99-vla-%EB%AA%A8%EB%8D%B8-d5321e71bb18
canonical_url
https://medium.com/@mdpman/gr-3-technical-report-gr-3-%EA%B8%B0%EC%88%A0-%EB%B3%B4%EA%B3%A0%EC%84%9C-%EB%B2%94%EC%9A%A9-%EB%A1%9C%EB%B4%87-%EC%A0%9C%EC%96%B4%EB%A5%BC-%EC%9C%84%ED%95%9C-%EC%B0%A8%EC%84%B8%EB%8C%80-%EB%B9%84%EC%A0%84-%EC%96%B8%EC%96%B4-%ED%96%89%EB%8F%99-vla-%EB%AA%A8%EB%8D%B8-d5321e71bb18
author_url
https://medium.com/@mdpman
status
ok
fetched_at
2026-06-20 20:29:01