로봇 파운데이션 모델 (RFM)

1. 단일공통 로봇AI, 로봇 파운데이션 모델 (RFM)의 개요

  • RFM: Robot Foundation Model

(1) 로봇 파운데이션 모델의 개념도

(2) 로봇 파운데이션 모델의 개념 및 필요성

개념필요성
멀티모달 Transformer와 VLA(Vision-Language-Action) 기반 단일 모델로 다양한 로봇을 제어하는 대형 AI 모델– 범용성 확장 (Generality)
– Zero-shot / Few-shot 적응력
– 멀티모달 통합 제어 (VLA)
– 데이터 효율성 및 스케일링 법칙
  • VLA(Vision-Language-Action) 기술의 결합과 LLM의 성공 방식을 물리적 로봇 제어에 이식해, 파편화되어 있던 로봇 AI 기술을 하나로 통합하기 위해 로봇 파운데이션 모델이 등장

 

2. 로봇 파운데이션 모델의 VLA 동작 절차 및 핵심 기술

(1) 로봇 파운데이션 모델의 VLA 동작 절차

  • 현재의 상태를 영상으로 Vision Encoder에 입력 및 사람의 지시를 언어로 Language Encoder에 입력하여, 현재 상태와 지시를 통해 추론 결과를 처리하는 Action Decoder를 통해 실제 로봇 동작으로 처리

(2) 로봇 파운데이션 모델의 핵심 기술

구분핵심 기술역할
기반
아키텍처
VLA (Vision-
Language-Action)
– 시각 정보(Vision)와 자연어 명령(Language) 입력
– 로봇의 관절 각도 및 이동 제어 신호(Action) 출력
멀티모달
Transformer
– 서로 다른 형태의 데이터를 단일 시퀀스(Token)로 변환
– 텍스트, 2D/3D 이미지, 촉각 데이터, 관절 상태 등
학습 환경Embodied AI
대규모 데이터셋
– 로봇 조종, 사람의 동작 시연 등 데이터 수집/통합
– 로봇의 신체성(Embodiment) 반영한 대규모 학습
시뮬레이션 및
Sim-to-Real
– 물리 시뮬레이터에서 수천 대의 로봇을 가상 학습
– 학습된 정책을 실제 물리 환경으로 전이 (Transfer)
실행 제어모션 토크나이저– 로봇의 물리적 움직임(위치, 토크 등)을 토큰화
LLM이 이해하는 이산적인 단어(Token) 형태로 변환
디퓨전 정책
및 안전 제어
– 디퓨전 모델 기반 정교하고 부드러운 궤적 생성
– 로봇 동작 특유의 불확실성을 해결, 안전 가드레일
  • 로봇 AI 모델들을 실제 세계의 복잡한 환경에 적용하기 위해 성능 평가 및 벤치마크 필요

 

3. 로봇 동작 성능 평가 방법 및 벤치마크 기술 비교

(1) 로봇 동작 성능 평가 방법 비교

비교 항목실세계 평가
(real-world evaluation)
시뮬레이션 평가
(simulation-based evaluation)
성능 평가 방법실제 환경에서 안전하고 안정적으로 동작하는지 확인통제된 조건에서 방대한 환경 및 물체 조합을 저비용으로 테스트
장점궁극적이고 확실한 검증확장성/재현성 문제 극복
단점반복 검증/재현 어려움실세계와 격차로 왜곡 발생
  • 범용 로봇 검증을 위해서는 시뮬레이션 평가 효율을 개선하는 기술과 인지적 추론 및 언어 과적합을 최적화하여 측정하는 기술을 포함한 다층적 벤치마크 필요

(2) 로봇 동작 벤치마크 기술 상호 비교

비교 항목REALMManipBenchRoboWM-BenchLIBERO-Para
핵심평가
대상
VLA 모델의 시각/물리/의미적 일반화 능력VLM의 하위 수준 물리 및 동작 추론 능력생성형 비디오 월드 모델의 실제 물리적 실행 가능성VLA 모델의 언어적 강건성과 과적합 진단
평가
방식
여러 교란 환경이 정렬된 고충실도 시뮬레이터 내 직접 궤적 실행이미지상 마커 기반 객관식 질문 형식으로 궤적 없이 평가생성 비디오를 역동역학 기반 행동으로 변환 후 시뮬레이션다수 의역 지시문을 부여하여 시뮬레이션 내 작업 궤적 실행
해결하려는
기존 한계
낮은 시각/물리 정합성 및 실세계 반복 평가 비용 문제대규모 정책 실행의 연산 비용, 검증 시간 문제시각적으로만 그럴듯한 월드 모델의 환각 현상제한된 지시어에만 동작하는 언어 과적합
특화된
데이터
영역
다수 객체, 조명/질량 변화 등 스트레스 테스트 조건유연체, 관절 물체, 동적 조작 등 다수 시나리오인간 손 영상 리타겟팅 및 유연체 조작 로봇 영상동의어, 간접 화법 등 다수 세분화된 언어 변형 세트
핵심평가
지표
진행률, 실제 성능과의 상관계수정답률과 인간 기준 성능 비교단계/과제 수준 물리적 실행 성공률의역 견고성, 시간 왜곡 오류 분석
  • 로봇 파운데이션 모델은 향후 VLA 기반 범용 제어가 고도화되어 Sim-to-Real 갭이 해소되고, Physical AI(Embodied AI)의 휴머노이드 상용화를 이끌 것으로 전망

 
[참고]

  • Google DeepMind, RT-1,2 (Robotics Transformer 1,2), 2023
  • 한국전자통신연구원, 손영성 외, 로봇 동작 성능 평가를 위한 벤치마크 기술 동향, 2026.7

콘텐츠 사용 시 출처 표기 부탁 드리고, 댓글은 큰 힘이 됩니다^^