← Back to list

로봇은 어떻게 배울까: 강화학습과 모방학습

로봇을 움직이는 방식은 크게 고전 제어 방식과 인공지능(AI) 학습 방식으로 나뉩니다.

Jay · 2025-09-13 13:02 · 55 claps · 5.7 min read
#강화학습 #모방학습 #로봇 #피지컬-ai #reinforcement-learning
Open on Medium ↗
Wiki topics: EDU · Education & Learning

로봇은 어떻게 배울까: 강화학습과 모방학습

Reinforcing the Value of Simulation by Teaching Dexterity to a Real Robot Hand, NVIDIA

Reinforcing the Value of Simulation by Teaching Dexterity to a Real Robot Hand, NVIDIA

로봇을 움직이는 방식은 크게 고전 제어 방식과 인공지능(AI) 학습 방식으로 나뉩니다.

우리가 흔히 보던 산업용 로봇이나 서비스 로봇은 고전 제어 방식으로, 직접 목표 위치를 설정해주고 그에 따른 모터 값을 계산하여 전달하는 방식입니다. 그러나 요즘 자주 보이는 휴머노이드와 같은 인공지능 로봇은 스스로 환경을 인지하고 판단하여, 모터를 제어합니다. 이를 피지컬AI(Physical AI)라고도 부릅니다.

이번에는 로봇이 인공지능 학습 방식들에 대해 알아보겠습니다.

강화학습 (Reinforcement Learning) 🐕

강화학습이란, 로봇과 같은 에이전트가 주어진 환경과 상호작용하면서 목표에 대한 보상을 최대화하기 위한 행동을 반복적으로 학습해나가는 머신러닝 기법입니다.

강화학습 예시: 강아지 나뭇가지 물어오기 훈련

강화학습 예시: 강아지 나뭇가지 물어오기 훈련

예를 들어, 강아지(에이전트)들판에서 나뭇가지를 들고있는 주인(환경)을 보고, 어떻게 행동해야 간식(보상)을 받을 수 있는지 학습해나가는 과정과 같습니다. 초기에는 그냥 뛰어다니다가, 우연히 나뭇가지를 물어다 주니 간식을 받는 경험을 반복하면서, 이게 보상을 최대로 얻는 방법이란 걸 학습하게 되는 것입니다.

Reinforcement Learning Model using Isaac Lab, UR5e, PPO

Reinforcement Learning Model using Isaac Lab, UR5e, PPO

위의 영상은 “로봇 팔이 목표 위치로 도달”하는 강화학습 모델을 만든 것입니다. 로봇이라는 에이전트가 시뮬레이션이라는 환경에서 목표위치와 현재 위치를 최소화하는 것을 보상으로 설정하고, 수만 번의 시도를 통해 가장 효율적인 동작을 학습합니다.

이런 강화학습 방식은 로봇 팔 위치 제어 뿐만 아니라, 물체를 집어 옮기고 조립하는 작업부터 휴머노이드 로봇의 보행, 자율주행 자동차와 같은 수많은 분야에서 활용되고 있습니다.

하지만 대부분의 강화학습은 시뮬레이션 내에서 진행되기 때문에, 시뮬레이션에서 학습한 행동이 실제 로봇의 행동으로 넘어가는 과정에서 예상치 못한 격차가 발생하게 됩니다. 이는 ***강화학습의 가장 큰 장벽*이 됩니다. 또한, 복잡한 작업일수록 어떤 행동에 보상을 줘야할지, 다시말해 목표에 대한 보상 함수**를 설계하는데에도 큰 어려움이 있습니다.

  • OpenAI, Figure 보행 강화학습

[embed]Natural Humanoid Walk Using Reinforcement Learning Natural Humanoid Walk Using Reinforcement Learningwww.figure.ai

  • Bostondynamics, Atlas 보행 강화학습

[embed]Starting on the Right Foot with Reinforcement Learning | Boston Dynamics We've integrated reinforcement learning into Spot's locomotion to enable the robot to handle more and more real-world…bostondynamics.com

모방학습 (Imitation Learning) 🧑🏻‍🍼

모방학습은 인간이 직접 로봇을 조작하며 동작을 보여주면, 로봇이 이를 모방하여 적절한 행동을 학습합니다.

강화학습이 수많은 시행착오를 통해 알아서 최적의 해답을 찾는 방식이었다면, 모방학습정답에 해당하는 전문가의 시연 데이터를 먼저 보고 학습하여 훨씬 빠르고 효율적으로 특정 작업을 배울 수 있습니다.

ALOHA, Stanford. 인간이 로봇의 동작을 시연하는 모습

ALOHA, Stanford. 인간이 로봇의 동작을 시연하는 모습

모방학습은 크게 두가지 방식으로 나뉩니다.

▶️ 행동 복제(Behavioral Cloning)

모방학습의 가장 기초가 되는 방식입니다. 전문가가 시연을 하면서 특정 상태(state)에서 어떤 행동(action)을 하는지 데이터로 기록한 뒤, 이를 그대로 따라 하도록 학습시킵니다. 마치 운전면허 학원에서 강사가 빨간불(상태)에서 브레이크 밟기(행동)을 하는 것을 보고 배우는 것과 같습니다.

  • 장점: 데이터만 충분하다면, 구현이 간단하고 학습이 빠르다.
  • 단점: 전문가의 데이터에 없는 새로운 상황에 마주치면 대처하기 어렵고, 작은 오차가 누적되어 실패로 이어지기 쉽다.

🔄 역 강화학습 (Inverse Reinforcement Learning)

전문가의 행동을 단순히 복제하는 것을 넘어, 왜 저런 행동을 했는가? 즉, 행동 내부에 숨겨진 의도나 목표(보상 함수)를 추론해내는 방식입니다. 전문가의 행동은 최적의 보상을 얻기 위한 결과라고 가정하고, 그 보상 체계를 역으로 학습하는 것입니다.

이렇게 학습된 보상 함수를 바탕으로 강화학습을 진행하면, 전문가의 데이터에 없던 상황에서도 그 의도에 맞는 최적의 행동을 스스로 찾아낼 수 있습니다.

  • 장점: 새로운 상황에 대한 대처 능력이 뛰어나고, 더 일반화된 성능을 보인다.
  • 단점: 알고리즘이 복잡하고 계산 비용이 많이 든다.

강화학습과 모방학습의 비교

강화학습과 모방학습의 비교

최근 연구 🔥

현재는 단순히 강화학습이나 모방학습 하나만 사용하는 것이 아니라, 서로의 단점을 보완해 같이 사용하는 방법도 활발히 연구되고 있습니다. 모방학습으로 어느 정도 기본기를 빠르게 갖춘 뒤, 강화학습을 통해 전문가보다 더 효율적인 동작이나 다양한 상황에 대처가능한 동작들을 학습시킵니다. 이를 통해 더 복잡한 작업들을 가능하게 합니다.

Helix: A Vision-Language-Action Model for Generalist Humanoid Control

Helix: A Vision-Language-Action Model for Generalist Humanoid Control

또한 강화학습과 모방학습 뿐만 아니라, 로봇을 자연어로 제어하고 더 다양한 환경에 대응하기 위한 방법(VLA)도 떠오르고 있습니다. VLA(Vision-Language-Action Model)는 GPT와 같은 대규모 파운데이션 모델을 기반으로 로봇의 동작을 만들어내는 방식입니다. 다음에는 이 내용에 대해 얘기를 나눠보겠습니다.

읽어주셔서 감사합니다.


메타데이터
post_id
f952d033808c
slug
로봇은-어떻게-배울까-강화학습과-모방학습-f952d033808c
url
https://medium.com/@jayinkr01/%EB%A1%9C%EB%B4%87%EC%9D%80-%EC%96%B4%EB%96%BB%EA%B2%8C-%EB%B0%B0%EC%9A%B8%EA%B9%8C-%EA%B0%95%ED%99%94%ED%95%99%EC%8A%B5%EA%B3%BC-%EB%AA%A8%EB%B0%A9%ED%95%99%EC%8A%B5-f952d033808c
canonical_url
https://medium.com/@jayinkr01/%EB%A1%9C%EB%B4%87%EC%9D%80-%EC%96%B4%EB%96%BB%EA%B2%8C-%EB%B0%B0%EC%9A%B8%EA%B9%8C-%EA%B0%95%ED%99%94%ED%95%99%EC%8A%B5%EA%B3%BC-%EB%AA%A8%EB%B0%A9%ED%95%99%EC%8A%B5-f952d033808c
author_url
https://medium.com/@jayinkr01
status
ok
fetched_at
2026-09-01 00:09:45