초소형 네트워크를 활용한 재귀적 추론 (Less is More: Recursive Reasoning with Tiny Networks) 상세 분석
### 배경 및 개요
LLM #DeepLearning #SamsungAI #RecursiveReasoning #EfficientAI초소형 네트워크를 활용한 재귀적 추론 (Less is More: Recursive Reasoning with Tiny Networks) 상세 분석
배경 및 개요
본 논문 “Less is More: Recursive Reasoning with Tiny Networks”는 삼성 SAIL 몬트리올의 Alexia Jolicoeur-Martineau가 발표한 연구로, 대규모 언어 모델(LLM)이 스도쿠, 미로 찾기, ARC-AGI와 같은 복잡하고 구조적인 추론 문제에서 겪는 어려움을 해결하기 위한 새로운 접근법을 제시합니다. 기존 LLM들은 자기회귀(auto-regressive) 방식으로 답변을 생성하기 때문에, 한 번의 토큰 오류가 전체 답변의 유효성을 무너뜨릴 수 있는 치명적인 단점을 가집니다. 이를 보완하기 위해 연쇄적 사고(Chain-of-Thoughts, CoT)나 테스트 시간 컴퓨팅(Test-Time Compute, TTC) 같은 기법이 사용되지만, 여전히 비용이 많이 들고 완벽한 해결책이 되지 못합니다.
이러한 배경 하에, 최근 Wang et al. (2025)이 제안한 계층적 추론 모델(Hierarchical Reasoning Model, HRM)이 주목받았습니다. HRM은 서로 다른 주파수에서 작동하는 두 개의 작은 신경망을 재귀적으로 사용하여, 적은 데이터(약 1,000개 예시)와 작은 모델(27M 파라미터)로도 LLM을 능가하는 성능을 보여주었습니다. 하지만 HRM은 생물학적 주장에 과도하게 의존하고, 암시적 함수 정리(Implicit Function Theorem)와 같은 복잡한 이론을 기반으로 하여 모델의 작동 원리를 이해하기 어려웠으며, 최적화되지 않은 부분이 존재했습니다.
본 논문은 HRM의 한계를 극복하고 그 핵심 아이디어를 극적으로 단순화하고 개선한 초소형 재귀 모델(Tiny Recursive Model, TRM)을 제안합니다. TRM의 핵심 철학은 “Less is More”로, 더 적은 파라미터(7M), 더 단순한 구조(단일 2계층 네트워크)를 사용하면서도 더 많은 재귀적 계산을 통해 HRM보다 훨씬 뛰어난 일반화 성능을 달성하는 것을 목표로 합니다. TRM은 복잡한 이론적 가정을 배제하고, 오직 재귀와 심층 지도(Deep Supervision)라는 두 가지 핵심 원리만을 사용하여 문제 해결 능력을 점진적으로 개선합니다. 그 결과, TRM은 LLM 파라미터의 0.01%도 안 되는 크기로 ARC-AGI-1에서 45%, ARC-AGI-2에서 8%의 테스트 정확도를 달성하며 대부분의 LLM을 능가하는 놀라운 효율성을 입증했습니다.
모델별 테스트 결과
TRM의 성능은 기존의 HRM 및 여러 대규모 LLM과 비교하여 그 우수성을 명확히 보여줍니다. 테스트는 주로 스도쿠, 미로 찾기, ARC-AGI 벤치마크에서 진행되었습니다.
1. 퍼즐 벤치마크 (스도쿠-익스트림, 미로-하드)
이 벤치마크들은 논리적 추론과 계획 능력을 측정하며, 특히 적은 훈련 데이터로 일반화하는 능력을 평가합니다.
| 모델 | 파라미터 수 | 스도쿠 정확도 (%) | 미로 정확도 (%) |
| : — — | : — — | : — — | : — — |
| LLM (CoT 방식) | | | |
| Deepseek R1 | 671B | 0.0 | 0.0 |
| Claude 3.7 8K | ? | 0.0 | 0.0 |
| 소형 모델 (직접 예측) | | | |
| Direct Prediction | 27M | 0.0 | 0.0 |
| HRM | 27M | 55.0 | 74.5 |
| TRM (본 논문 제안) | | | |
| TRM-Att (Self-Attention) | 7M | 74.7 | 85.3 |
| TRM-MLP (MLP-Mixer) | 5M | 87.4 | 0.0 |
-
스도쿠-익스트림: TRM-MLP 모델은 단 5M 파라미터로 87.4%라는 경이로운 정확도를 달성했습니다. 이는 27M 파라미터를 사용한 HRM의 55.0%를 압도하는 수치이며, 거대 LLM들이 전혀 풀지 못한(0.0%) 것과 극명한 대조를 이룹니다. 이는 고정된 크기의 입력(9x9 그리드)에서는 Self-Attention보다 MLP-Mixer 구조가 과적합을 방지하고 일반화에 더 유리함을 시사합니다.
-
미로-하드: 30x30의 더 큰 그리드에서는 Self-Attention의 귀납적 편향(inductive bias)이 유리하게 작용하여, TRM-Att 모델이 7M 파라미터로 85.3%의 정확도를 기록했습니다. 이 또한 HRM의 74.5%를 크게 상회하는 결과입니다.
2. ARC-AGI 벤치마크
ARC-AGI는 인간에게는 쉽지만 AI에게는 매우 어려운 기하학적 추론 능력 평가 벤치마크입니다.
| 모델 | 파라미터 수 | ARC-1 정확도 (%) | ARC-2 정확도 (%) |
| : — — | : — — | : — — | : — — |
| LLM (CoT 방식) | | | |
| Deepseek R1 | 671B | 15.8 | 1.3 |
| Gemini 2.5 Pro 32K | ? | 37.0 | 4.9 |
| Grok-4-thinking | 1.7T | 66.7 | 16.0 |
| Bespoke (Grok-4) | 1.7T | 79.6 | 29.4 |
| 소형 모델 (직접 예측) | | | |
| Direct Prediction | 27M | 21.0 | 0.0 |
| HRM | 27M | 40.3 | 5.0 |
| TRM-Att (본 논문 제안) | 7M | 44.6 | 7.8 |
| TRM-MLP (Ours) | 19M | 29.6 | 2.4 |
-
ARC-AGI 결과에서 TRM-Att 모델은 7M이라는 초소형 파라미터로 ARC-AGI-1에서 44.6%, ARC-AGI-2에서 7.8%의 정확도를 달성했습니다. 이는 27M 파라미터의 HRM(40.3% / 5.0%)을 능가하는 성능입니다.
-
비록 Grok-4와 같은 최첨단 LLM에는 미치지 못하지만, TRM은 수백 배에서 수천 배 작은 모델 크기와 훨씬 적은 데이터로 직접 훈련하여 달성한 성과라는 점에서 그 가치가 매우 큽니다. 이는 모델의 크기 확장만이 유일한 해답이 아니며, 효율적인 알고리즘 설계가 얼마나 중요한지를 보여주는 강력한 증거입니다.
테스트 데이터셋
본 연구에서 사용된 데이터셋들은 공통적으로 적은 양의 훈련 데이터를 제공하여, 모델의 일반화 능력과 데이터 효율성을 극한으로 시험하도록 설계되었습니다.
-
Sudoku-Extreme: 9x9 크기의 매우 어려운 스도쿠 퍼즐 데이터셋입니다. 훈련 샘플은 1,000개에 불과하지만, 테스트 샘플은 423,000개에 달하여 강력한 일반화 성능을 요구합니다.
-
Maze-Hard: 30x30 크기의 미로 찾기 데이터셋으로, 최단 경로 길이가 110 이상인 어려운 문제들로 구성됩니다. 훈련 및 테스트 세트 모두 1,000개의 샘플을 포함합니다.
-
ARC-AGI-1 & ARC-AGI-2: François Chollet이 제안한 추상적 추론 능력 벤치마크입니다. 각 태스크는 2~3개의 입출력 예시(demonstration)를 보고, 새로운 테스트 입력에 대한 올바른 출력을 생성해야 합니다. 인간에게는 직관적이지만 현재 AI 모델에게는 매우 어려운 문제입니다. ARC-AGI-1은 800개, ARC-AGI-2는 1120개의 태스크를 포함합니다.
-
데이터 증강: 모든 데이터셋에 대해 적극적인 데이터 증강 기법이 사용되었습니다. 스도쿠는 규칙을 깨지 않는 선에서 숫자 셔플링을, 미로와 ARC-AGI는 색상 순열, 회전, 반전 등의 기하학적 변환을 적용하여 적은 데이터로부터 최대한의 학습 효과를 이끌어냈습니다.
연구 방법론 및 결론
연구 방법론: HRM의 한계 분석 및 TRM의 혁신
본 논문은 먼저 기존 HRM의 세 가지 주요 문제점을 명확히 지적하고, 이를 해결하는 방향으로 TRM을 설계했습니다.
-
불확실한 이론적 기반 (IFT)의 배제: HRM은 암시적 함수 정리(IFT)를 통해 재귀 과정의 마지막 단계에서만 역전파를 수행하는 것을 정당화했지만, 실제로는 재귀가 고정점(fixed-point)에 도달한다는 보장이 없었습니다. TRM은 이 가정을 완전히 버리고, 대신 각 심층 지도 단계 내의 전체 재귀 과정에 대해 역전파를 수행합니다. 이는 계산적으로는 더 무겁지만 이론적으로 견고하며, 결과적으로 56.5%에서 87.4%로의 엄청난 성능 향상을 이끌어냈습니다.
-
단순화된 아키텍처: HRM은 저수준/고수준이라는 생물학적 비유에 기반한 두 개의 네트워크와 두 개의 잠재 변수(zL, zH)를 사용했습니다. TRM은 이를 훨씬 직관적으로 재해석하여, 하나의 단일 네트워크와 현재의 예측(y) 및 잠재적 추론(z)이라는 두 개의 변수만 사용하도록 구조를 단순화했습니다. 이는 파라미터 수를 절반으로 줄이면서도 오히려 성능을 향상시켰습니다(82.4% → 87.4%).
-
효율성 개선: HRM의 적응형 계산 시간(ACT)은 Q-러닝 기반으로 구현되어 매 최적화 단계마다 두 번의 순방향 전파(forward pass)를 필요로 했습니다. TRM은 이를 정답을 맞혔는지 여부에 대한 간단한 이진 교차 엔트로피(Binary Cross-Entropy) 손실로 대체하여, 단 한 번의 순방향 전파만으로 ACT를 구현하고 훈련 속도를 높였습니다. 또한, 가중치에 지수 이동 평균(EMA)을 적용하여 작은 데이터셋에서의 훈련 안정성을 크게 향상시켰습니다.
결론
TRM은 HRM의 복잡성을 제거하고 핵심 원리만을 정제하여, “더 작은 모델과 더 많은 재귀적 계산이 더 나은 일반화 성능을 낳는다”는 ‘Less is More’ 철학을 성공적으로 입증했습니다. TRM은 복잡한 이론이나 생물학적 비유 없이, 단일 초소형 네트워크가 재귀적으로 자신의 예측과 추론을 개선해나가는 간단하고 강력한 메커니즘을 제시합니다. 이는 LLM이 고전하는 어려운 추론 문제에 대해, 모델의 크기를 키우는 것만이 유일한 해법이 아니며, 효율적이고 정교한 알고리즘 설계가 훨씬 적은 비용으로 더 높은 성능을 달성할 수 있음을 보여주는 중요한 연구입니다.
시사점
본 연구는 AI 모델 개발, 특히 LLM 분야에 다음과 같은 중요한 시사점을 던집니다.
-
파라미터 효율성의 재조명: 이 연구는 특정 문제 영역에서는 알고리즘의 개선(예: 재귀적 추론)이 모델 크기 확장보다 훨씬 효과적일 수 있음을 명확히 보여줍니다. 이는 작고 효율적이면서도 강력한 AI 모델을 개발할 수 있는 새로운 가능성을 열어줍니다.
-
자기회귀 방식을 넘어서: 퍼즐 풀기와 같이 검증과 점진적 개선이 필요한 문제의 경우, TRM과 같이 상태를 반복적으로 개선하는 재귀 모델이 순차적으로 토큰을 생성하는 자기회귀 모델보다 더 자연스럽고 효과적인 접근법일 수 있습니다.
-
소형 전문 모델의 미래: 거대한 범용 LLM과 함께, 특정 도메인에서 초인적인 성능을 발휘하는 소형 전문가 모델이 공존하는 AI 생태계의 미래를 제시합니다. 이는 AI를 더 다양한 환경에 저비용으로 배포할 수 있게 할 것입니다.
-
과적합과 일반화에 대한 통찰: 적은 데이터 환경에서는 파라미터를 늘리는 것이 오히려 일반화 성능을 해칠 수 있으며, 재귀를 통한 ‘계산적 깊이’ 확보가 과적합을 피하는 더 나은 대안이 될 수 있음을 실증적으로 보여주었습니다.
Source: https://arxiv.org/abs/2510.04871
AI #LLM #DeepLearning #SamsungAI #RecursiveReasoning #EfficientAI#인공지능 #딥러닝 #삼성AI #재귀추론 #효율적AI #소형모델
메타데이터
- post_id
- 0271f757b2a1
- slug
- 초소형-네트워크를-활용한-재귀적-추론-less-is-more-recursive-reasoning-with-tiny-networks-상세-분석-0271f757b2a1
- url
- https://medium.com/@mdpman/%EC%B4%88%EC%86%8C%ED%98%95-%EB%84%A4%ED%8A%B8%EC%9B%8C%ED%81%AC%EB%A5%BC-%ED%99%9C%EC%9A%A9%ED%95%9C-%EC%9E%AC%EA%B7%80%EC%A0%81-%EC%B6%94%EB%A1%A0-less-is-more-recursive-reasoning-with-tiny-networks-%EC%83%81%EC%84%B8-%EB%B6%84%EC%84%9D-0271f757b2a1
- canonical_url
- https://medium.com/@mdpman/%EC%B4%88%EC%86%8C%ED%98%95-%EB%84%A4%ED%8A%B8%EC%9B%8C%ED%81%AC%EB%A5%BC-%ED%99%9C%EC%9A%A9%ED%95%9C-%EC%9E%AC%EA%B7%80%EC%A0%81-%EC%B6%94%EB%A1%A0-less-is-more-recursive-reasoning-with-tiny-networks-%EC%83%81%EC%84%B8-%EB%B6%84%EC%84%9D-0271f757b2a1
- author_url
- https://medium.com/@mdpman
- status
- ok
- fetched_at
- 2026-06-09 15:37:30