1. 단일공통 로봇AI, 로봇 파운데이션 모델 (RFM)의 개요
- RFM: Robot Foundation Model
(1) 로봇 파운데이션 모델의 개념도
- 다양한 데이터 소스로부터 학습하여 공통된 단일 로봇AI의 파운데이션 모델을 구축하여 다양한 전용 로봇, Physical AI (Embodied AI)에 적용하여 효율적으로 활용
(2) 로봇 파운데이션 모델의 개념 및 필요성
| 개념 | 필요성 |
|---|---|
| 멀티모달 Transformer와 VLA(Vision-Language-Action) 기반 단일 모델로 다양한 로봇을 제어하는 대형 AI 모델 | – 범용성 확장 (Generality) – Zero-shot / Few-shot 적응력 – 멀티모달 통합 제어 (VLA) – 데이터 효율성 및 스케일링 법칙 |
- VLA(Vision-Language-Action) 기술의 결합과 LLM의 성공 방식을 물리적 로봇 제어에 이식해, 파편화되어 있던 로봇 AI 기술을 하나로 통합하기 위해 로봇 파운데이션 모델이 등장
2. 로봇 파운데이션 모델의 VLA 동작 절차 및 핵심 기술
(1) 로봇 파운데이션 모델의 VLA 동작 절차
- 현재의 상태를 영상으로 Vision Encoder에 입력 및 사람의 지시를 언어로 Language Encoder에 입력하여, 현재 상태와 지시를 통해 추론 결과를 처리하는 Action Decoder를 통해 실제 로봇 동작으로 처리
(2) 로봇 파운데이션 모델의 핵심 기술
| 구분 | 핵심 기술 | 역할 |
|---|---|---|
| 기반 아키텍처 | VLA (Vision- Language-Action) | – 시각 정보(Vision)와 자연어 명령(Language) 입력 – 로봇의 관절 각도 및 이동 제어 신호(Action) 출력 |
| 멀티모달 Transformer | – 서로 다른 형태의 데이터를 단일 시퀀스(Token)로 변환 – 텍스트, 2D/3D 이미지, 촉각 데이터, 관절 상태 등 | |
| 학습 환경 | Embodied AI 대규모 데이터셋 | – 로봇 조종, 사람의 동작 시연 등 데이터 수집/통합 – 로봇의 신체성(Embodiment) 반영한 대규모 학습 |
| 시뮬레이션 및 Sim-to-Real | – 물리 시뮬레이터에서 수천 대의 로봇을 가상 학습 – 학습된 정책을 실제 물리 환경으로 전이 (Transfer) | |
| 실행 제어 | 모션 토크나이저 | – 로봇의 물리적 움직임(위치, 토크 등)을 토큰화 – LLM이 이해하는 이산적인 단어(Token) 형태로 변환 |
| 디퓨전 정책 및 안전 제어 | – 디퓨전 모델 기반 정교하고 부드러운 궤적 생성 – 로봇 동작 특유의 불확실성을 해결, 안전 가드레일 |
- 로봇 AI 모델들을 실제 세계의 복잡한 환경에 적용하기 위해 성능 평가 및 벤치마크 필요
3. 로봇 동작 성능 평가 방법 및 벤치마크 기술 비교
(1) 로봇 동작 성능 평가 방법 비교
| 비교 항목 | 실세계 평가 (real-world evaluation) | 시뮬레이션 평가 (simulation-based evaluation) |
|---|---|---|
| 성능 평가 방법 | 실제 환경에서 안전하고 안정적으로 동작하는지 확인 | 통제된 조건에서 방대한 환경 및 물체 조합을 저비용으로 테스트 |
| 장점 | 궁극적이고 확실한 검증 | 확장성/재현성 문제 극복 |
| 단점 | 반복 검증/재현 어려움 | 실세계와 격차로 왜곡 발생 |
- 범용 로봇 검증을 위해서는 시뮬레이션 평가 효율을 개선하는 기술과 인지적 추론 및 언어 과적합을 최적화하여 측정하는 기술을 포함한 다층적 벤치마크 필요
(2) 로봇 동작 벤치마크 기술 상호 비교
| 비교 항목 | REALM | ManipBench | RoboWM-Bench | LIBERO-Para |
|---|---|---|---|---|
| 핵심평가 대상 | VLA 모델의 시각/물리/의미적 일반화 능력 | VLM의 하위 수준 물리 및 동작 추론 능력 | 생성형 비디오 월드 모델의 실제 물리적 실행 가능성 | VLA 모델의 언어적 강건성과 과적합 진단 |
| 평가 방식 | 여러 교란 환경이 정렬된 고충실도 시뮬레이터 내 직접 궤적 실행 | 이미지상 마커 기반 객관식 질문 형식으로 궤적 없이 평가 | 생성 비디오를 역동역학 기반 행동으로 변환 후 시뮬레이션 | 다수 의역 지시문을 부여하여 시뮬레이션 내 작업 궤적 실행 |
| 해결하려는 기존 한계 | 낮은 시각/물리 정합성 및 실세계 반복 평가 비용 문제 | 대규모 정책 실행의 연산 비용, 검증 시간 문제 | 시각적으로만 그럴듯한 월드 모델의 환각 현상 | 제한된 지시어에만 동작하는 언어 과적합 |
| 특화된 데이터 영역 | 다수 객체, 조명/질량 변화 등 스트레스 테스트 조건 | 유연체, 관절 물체, 동적 조작 등 다수 시나리오 | 인간 손 영상 리타겟팅 및 유연체 조작 로봇 영상 | 동의어, 간접 화법 등 다수 세분화된 언어 변형 세트 |
| 핵심평가 지표 | 진행률, 실제 성능과의 상관계수 | 정답률과 인간 기준 성능 비교 | 단계/과제 수준 물리적 실행 성공률 | 의역 견고성, 시간 왜곡 오류 분석 |
- 로봇 파운데이션 모델은 향후 VLA 기반 범용 제어가 고도화되어 Sim-to-Real 갭이 해소되고, Physical AI(Embodied AI)의 휴머노이드 상용화를 이끌 것으로 전망
[참고]
- Google DeepMind, RT-1,2 (Robotics Transformer 1,2), 2023
- 한국전자통신연구원, 손영성 외, 로봇 동작 성능 평가를 위한 벤치마크 기술 동향, 2026.7