X

로봇 파운데이션 모델 (RFM)

1. 단일공통 로봇AI, 로봇 파운데이션 모델 (RFM)의 개요

  • RFM: Robot Foundation Model

(1) 로봇 파운데이션 모델의 개념도

(2) 로봇 파운데이션 모델의 개념 및 필요성

개념 필요성
멀티모달 Transformer와 VLA(Vision-Language-Action) 기반 단일 모델로 다양한 로봇을 제어하는 대형 AI 모델 – 범용성 확장 (Generality)
– Zero-shot / Few-shot 적응력
– 멀티모달 통합 제어 (VLA)
– 데이터 효율성 및 스케일링 법칙
  • VLA(Vision-Language-Action) 기술의 결합과 LLM의 성공 방식을 물리적 로봇 제어에 이식해, 파편화되어 있던 로봇 AI 기술을 하나로 통합하기 위해 로봇 파운데이션 모델이 등장

 

2. 로봇 파운데이션 모델의 VLA 동작 절차 및 핵심 기술

(1) 로봇 파운데이션 모델의 VLA 동작 절차

  • 현재의 상태를 영상으로 Vision Encoder에 입력 및 사람의 지시를 언어로 Language Encoder에 입력하여, 현재 상태와 지시를 통해 추론 결과를 처리하는 Action Decoder를 통해 실제 로봇 동작으로 처리

(2) 로봇 파운데이션 모델의 핵심 기술

구분 핵심 기술 역할
기반
아키텍처
VLA (Vision-
Language-Action)
– 시각 정보(Vision)와 자연어 명령(Language) 입력
– 로봇의 관절 각도 및 이동 제어 신호(Action) 출력
멀티모달
Transformer
– 서로 다른 형태의 데이터를 단일 시퀀스(Token)로 변환
– 텍스트, 2D/3D 이미지, 촉각 데이터, 관절 상태 등
학습 환경 Embodied AI
대규모 데이터셋
– 로봇 조종, 사람의 동작 시연 등 데이터 수집/통합
– 로봇의 신체성(Embodiment) 반영한 대규모 학습
시뮬레이션 및
Sim-to-Real
– 물리 시뮬레이터에서 수천 대의 로봇을 가상 학습
– 학습된 정책을 실제 물리 환경으로 전이 (Transfer)
실행 제어 모션 토크나이저 – 로봇의 물리적 움직임(위치, 토크 등)을 토큰화
LLM이 이해하는 이산적인 단어(Token) 형태로 변환
디퓨전 정책
및 안전 제어
– 디퓨전 모델 기반 정교하고 부드러운 궤적 생성
– 로봇 동작 특유의 불확실성을 해결, 안전 가드레일
  • 로봇 AI 모델들을 실제 세계의 복잡한 환경에 적용하기 위해 성능 평가 및 벤치마크 필요

 

3. 로봇 동작 성능 평가 방법 및 벤치마크 기술 비교

(1) 로봇 동작 성능 평가 방법 비교

비교 항목 실세계 평가
(real-world evaluation)
시뮬레이션 평가
(simulation-based evaluation)
성능 평가 방법 실제 환경에서 안전하고 안정적으로 동작하는지 확인 통제된 조건에서 방대한 환경 및 물체 조합을 저비용으로 테스트
장점 궁극적이고 확실한 검증 확장성/재현성 문제 극복
단점 반복 검증/재현 어려움 실세계와 격차로 왜곡 발생
  • 범용 로봇 검증을 위해서는 시뮬레이션 평가 효율을 개선하는 기술과 인지적 추론 및 언어 과적합을 최적화하여 측정하는 기술을 포함한 다층적 벤치마크 필요

(2) 로봇 동작 벤치마크 기술 상호 비교

비교 항목 REALM ManipBench RoboWM-Bench LIBERO-Para
핵심평가
대상
VLA 모델의 시각/물리/의미적 일반화 능력 VLM의 하위 수준 물리 및 동작 추론 능력 생성형 비디오 월드 모델의 실제 물리적 실행 가능성 VLA 모델의 언어적 강건성과 과적합 진단
평가
방식
여러 교란 환경이 정렬된 고충실도 시뮬레이터 내 직접 궤적 실행 이미지상 마커 기반 객관식 질문 형식으로 궤적 없이 평가 생성 비디오를 역동역학 기반 행동으로 변환 후 시뮬레이션 다수 의역 지시문을 부여하여 시뮬레이션 내 작업 궤적 실행
해결하려는
기존 한계
낮은 시각/물리 정합성 및 실세계 반복 평가 비용 문제 대규모 정책 실행의 연산 비용, 검증 시간 문제 시각적으로만 그럴듯한 월드 모델의 환각 현상 제한된 지시어에만 동작하는 언어 과적합
특화된
데이터
영역
다수 객체, 조명/질량 변화 등 스트레스 테스트 조건 유연체, 관절 물체, 동적 조작 등 다수 시나리오 인간 손 영상 리타겟팅 및 유연체 조작 로봇 영상 동의어, 간접 화법 등 다수 세분화된 언어 변형 세트
핵심평가
지표
진행률, 실제 성능과의 상관계수 정답률과 인간 기준 성능 비교 단계/과제 수준 물리적 실행 성공률 의역 견고성, 시간 왜곡 오류 분석
  • 로봇 파운데이션 모델은 향후 VLA 기반 범용 제어가 고도화되어 Sim-to-Real 갭이 해소되고, Physical AI(Embodied AI)의 휴머노이드 상용화를 이끌 것으로 전망

 
[참고]

  • Google DeepMind, RT-1,2 (Robotics Transformer 1,2), 2023
  • 한국전자통신연구원, 손영성 외, 로봇 동작 성능 평가를 위한 벤치마크 기술 동향, 2026.7
Categories: 디지털서비스
도리: