Part III: 접촉과 지능

Chapter 10: VLA·월드모델 — 지능과 공장의 연결

집필일: 2026-08-18 최종수정일: 2026-08-18

개요

이 장의 질문은 다음과 같다. 공장이 비전-언어-행동 모델(VLA)이나 월드모델을 시연이 아니라 운영 능력으로 인정하려면 무엇이 공개되어야 하는가? 모델은 물체를 알아보고, 계획을 설명하고, 미래 영상을 예측하거나, 행동 시퀀스를 출력할 수 있다. 그러나 그 어느 출력도 로봇이 사이클 시간을 지키고, 지그를 보호하고, 잘못 잡은 부품에서 복구하고, 품질 기록을 남기며, 작업자 옆에서 안전하게 멈춘다는 사실을 단독으로 증명하지 못한다.

이 장의 논지는 범용 모델도 관측, 행동 표현, 학습 데이터, 지연시간, 신체, 하위 제어기, 복구 체계의 경계를 벗어나지 못한다는 것이다. 모델은 물리적 의사결정 사슬의 한 층이다. 유용한 범용성은 편집 영상에 등장하는 과제 수가 아니라, 기존 제어·안전 계층이 실행하고 검증하고 되돌릴 수 있는 행동을 모델이 제안하는 운용 영역의 크기로 측정해야 한다.

Moxian Technology, DexRobot, AI² Robotics는 이 장의 고정 심층 프로필 세 곳이다 [1] [6] [10]. 세 회사는 각각 촉각 관측 기반, 영리한 손과 데이터 수집 생태계, 로봇과 VLA를 결합한 통합 플랫폼이라는 서로 다른 위치에 있다. 같은 증거 틀로 비교하면 어떤 모델 주장이 실제로 공개되었고 어떤 인터페이스가 공개 범위 밖인지 드러난다.

이 장을 읽고 나면... - 관측, 행동, 데이터, 지연시간, 제어 경계, 복구, 개방성, 신체 항목으로 VLA를 명세할 수 있다. - 예측형 월드모델을 그럴듯한 영상 생성기나 디지털 리플레이와 구분할 수 있다. - 발행사나 행사 주최 측 주장을 독립 벤치마크로 바꾸지 않고 세 회사를 비교할 수 있다. - 비공개 데이터, 닫힌 가중치, 미공개 리셋 규칙, 숨은 기존 제어기가 재현성을 제한하는 지점을 찾을 수 있다. - 기존 산업 자동화를 기준선으로 삼고 측정 가능한 관문을 통과한 모델만 승격하는 공장 평가를 설계할 수 있다.

10.1 산업 자동화 기준선이 대조군이다

VLA가 들어가는 공장에는 이미 제어 구조가 있다. 프로그래머블 논리 제어기(PLC)가 설비 순서를 정한다. 로봇 프로그램은 자세, 속도, 구역을 정의한다. 안전 제어기는 문, 스캐너, 인에이블 장치, 비상 정지를 감시한다. 머신비전은 부품의 종류나 자세를 추정한다. 제조 실행 시스템(MES)은 작업을 배정하고 이력을 기록한다. 작업자는 걸림을 해소하고 초품을 확인하며 복구 절차를 소유한다. 이 기준선은 유연하지 않을 수 있지만 경계가 보인다.

올바른 질문은 학습 정책이 점대점 프로그램보다 더 영리해 보이는지가 아니다. 기존 기능을 모두 계산한 뒤에도 학습 계층이 셀을 개선하는지다. VLA가 제품 변형에는 대응하지만 리셋, 저속 운전, 추가 연산, 수동 확인, 기록되지 않은 교정을 늘린다면 겉보기 유연성이 산출량을 높이지 않을 수 있다. 반대로 품질, 안전, 가동률을 유지하며 전환 시간을 줄인다면 원시 사이클 시간이 조금 느려도 가치가 생긴다.

산업 자동화는 권한도 분리한다. 계획기는 스킬을 고르고, 모션 계획기는 경로를 만들며, 서보 루프는 명령을 추종한다. 인증된 안전 기능은 이들과 독립적으로 기계를 멈출 수 있다. 학습형 종단간 시스템은 개념상 이 층을 흐리지만, 배치 단계에서는 관절 한계, 충돌 검사, 힘 한계, 보호 정지, 인터록, 최종 동작 허가를 누가 소유하는지 답해야 한다.

SayCan은 언어 관련성으로 스킬을 순위화하고 학습된 어포던스 값으로 실행 가능성을 평가하는 모듈식 선례를 보였다 [17]. Code as Policies는 제공된 지각·제어 인터페이스를 호출하는 프로그램을 생성한다 [18]. 이들은 최신 VLA와 다르지만 한 가지 교훈은 오래간다. 범용 추론은 경계가 분명한 실행 계약을 통과해야 물리 행동이 된다.

10.2 모델 계약: 카메라 프레임에서 검증된 결과까지

공장용 모델 카드는 관측 계약에서 시작해야 한다. 어느 카메라를 어떤 해상도와 주기로 쓰는가? 관절 상태, 힘, 토크, 촉각 배열, 그리퍼 폭, 이동 베이스 자세, 과제 이력이 동기화되는가? 언어 명령은 자유 문장인가, 통제된 작업 코드인가? 모델이 작업지시의 변형, 지그 상태, 공구 식별자, 품질 결과를 보는가? 관측이 빠지면 물리적으로 다른 두 상태가 모델에는 같게 보일 수 있다.

행동 계약도 중요하다. RT-1은 로봇 행동을 토큰화하고 폐루프로 실행한다 [19]. RT-2는 웹 규모의 시각-언어 지식과 로봇 행동 토큰을 함께 학습한다 [20]. Diffusion Policy는 다봉형 행동 시퀀스를 표현하고 후퇴 지평선 방식으로 실행한다 [21]. π₀는 여러 신체에 걸쳐 연속 행동을 생성하기 위해 흐름 정합을 사용한다 [24]. 그러나 이 명칭만으로는 관절 위치와 말단 변화량, 행동 지평, 주기, 좌표계, 그리퍼 의미, 예측 사이를 보간하는 제어기의 차이를 알 수 없다.

지연시간은 최소 네 부분이다. 센서 취득, 모델 추론, 통신, 하위 실행이다. 보고된 모델 주기에는 노출 시간, 네트워크 왕복, 행동 덩어리 버퍼링, 충돌 검사, 액추에이터 반응이 빠질 수 있다. 장기 계획은 수 초를 허용할 수 있지만 시각 서보는 그렇지 않다. 접촉 안정화에는 파운데이션 모델보다 훨씬 빠른 로컬 루프가 필요할 수 있다. 따라서 액추에이터가 명령을 적용하는 순간 관측이 얼마나 오래되었는지 종단간 분포로 보고해야 한다.

복구는 모델 계약의 일부다. 시도는 성공, 안전 중단, 작업자 교정, 리셋, 부품 손상, 완료 여부 불명으로 끝날 수 있다. 시스템은 실패를 식별하고, 복구를 고르고, 증거를 보존하고, 부품을 계속 사용해도 되는지 판단해야 한다. 완료된 실행만 세면 개입 비용과 불량 상태를 성공으로 받아들일 위험이 가려진다.

계약 항목 최소 공개 내용 공장 질문
관측 모달리티, 주기, 동기화, 이력 안전·품질상 다른 상태를 모두 구분하는가?
행동 좌표, 지평, 주기, 단위, 그리퍼 의미 로봇 제어기에 정확히 무엇이 전달되는가?
데이터 출처, 라이선스, 과제·로봇 혼합, 분할 이력 이 셀로의 전이를 무엇이 뒷받침하는가?
지연시간 종단간 분포, 연산 위치, 폴백 오래된 추론이 동작이나 복구를 불안정하게 하는가?
제어 경계 계획, 충돌, 힘, 서보, 안전 소유자 어느 계층이 모델을 무효화할 수 있는가?
복구 감지, 재시도 한도, 개입, 리셋 첫 오류 뒤에 무엇이 일어나는가?
개방성 가중치, 코드, 데이터, 인터페이스, 라이선스 구매자가 재현하고 유지할 수 있는가?

10.3 심층 프로필 I — Moxian Technology

한국어 표기는 목시안 테크놀로지, 영어명은 Moxian Technology, 중국어 법인명과 브랜드는 墨现科技(东莞)有限公司 / 墨现科技다. 공식 브로슈어는 2021년 설립을 밝히고, 공식 연락처는 광둥성 둥관 쑹산후 주소를 제시한다 [2] [3]. 따라서 이 프로필은 관측 경계의 촉각 센서 회사에 관한 것이며, 공개된 VLA 개발사로 분류하지 않는다.

대표 제품은 유연 압력 센서, 로봇 전자피부, 충돌 감지 제품, 용도별 압력 배열이다. 공식 로봇 전자피부 페이지는 접촉 위치를 찾고 힘 피드백을 제공하기 위한 손가락 모듈과 손 전체 피복을 설명한다 [4]. 기술 기반은 감지 재료, 구조, 제조 공정, 수집 전자장치, 응용 소프트웨어의 통합이다. 공개 자료에서는 자체 월드모델, 행동 디코더, 범용 로봇 정책, 종단간 VLA를 확인할 수 없다.

WRC 주최 측은 Moxian의 촉각 데이터 수집 장갑을 368개 택셀과 제곱센티미터당 9개 택셀 밀도로 설명한다 [1]. 이는 주최자가 해당 전시 사양을 게시했다는 강한 증거다. 그러나 보정 정확도, 이력현상, 드리프트, 전단 감도, 양품률, 착용감, 정책 성능 개선을 독립적으로 검증한 벤치마크는 아니다.

VLA 관점에서 Moxian의 가치는 관측에 있다. 촉각 배열은 가려짐으로 비전이 잃는 접촉을 드러낼 수 있다. 눈에는 비슷한 안정 파지와 미끄러짐, 삽입 시작과 걸림을 구분할 수 있다. 하지만 배열을 달았다고 곧바로 모델 입력 토큰이 생기지는 않는다. 보정, 죽은 채널 지도, 시간 정렬, 정규화, 온도 보상, 센서 교체, 접촉 라벨 정의가 신호가 학습과 배치에서 살아남는지를 결정한다.

포착한 공식 자료에서 Moxian은 로봇 행동 스택을 소유한다고 주장하지 않으므로 행동과 제어기 항목은 미공개다. 센서는 손 제어기, 상태 추정기, VLA, 품질 감시기에 입력될 수 있다. 누가 힘 루프를 닫는지, 그 루프가 얼마나 빠른지, 안전 한계가 모델 명령을 어떻게 덮어쓰는지는 통합자 몫이다. 공개된 종단간 지연시간과 복구 동작도 없다.

SDK, ROS, Isaac 지원은 인정된 공식 근거에서 확인되지 않았다. 사이트는 하드웨어와 솔루션 납품을 소개하지만 버전이 붙은 공개 API, ROS 메시지 정의, Isaac 확장, 기준 드라이버 저장소, 모델 라이선스는 찾지 못했다. 그러므로 개방성은 추정으로 ‘폐쇄’라 쓰지 않고 인터페이스 상세 미공개라고 기록한다. 구매자는 원시·처리 데이터 스키마, 타임스탬프, 보정 파일, 오류 코드, 교체 절차, 지원 미들웨어 버전을 요청해야 한다.

상업 성숙도는 공식 사이트의 제조·납품 설명에 근거해 감지 제품의 생산과 맞춤 납품으로 판단한다. 홈페이지는 500곳이 넘는 고객과 20개가 넘는 성 지역 서비스를 보고하지만 발행사가 정의한 견인력 수치이며 감사된 로봇 배치가 아니다 [5]. 매출, 매출총이익, 제품별 출하, 가동 중 로봇 설치, 갱신, 승인 데이터 시간, 정책 개선 효과는 미공개다. 투자 기관 로고는 있으나 비교 가능한 라운드 금액은 공식 근거에서 공개되지 않았다.

WRC 상태는 촉각 장갑 전시에 대해 주최 측 근거가 있다. 미디어 코퍼스 가시성은 대상 기사군, 기간, 언어 규칙, 중복 제거가 정해지지 않아 미측정이다. 강점은 조밀한 촉각 피복, 제조 지향 센서군, 접촉 가시성, 구체적인 수집 장치다. 한계는 공개 VLA 부재, 독립 검증된 정책 이득 부재, 미공개 개발자 인터페이스, 장기 보정·교체 경제성 부재다.

신뢰도는 법인명, 2021년 설립, 둥관 위치, 공식 제품, 주최 측 368택셀 사양에 높음, 생산 성숙도와 발행사 고객 수에 중간, 모델 통합, 지연시간, 개방성, 데이터셋 기여, 정책 효과에 낮음이다. 아래 공식 응용 사진은 센서 피복이 적용된 로봇 손의 물리적 형상만 보여 주며, 368택셀 장갑 사양이나 보정·정책 성능을 검증하지 않는다.

Figure 10.1: 투명 패널에 접촉하는 센서 피복 로봇 손을 보여 주는 Moxian 공식 전자피부 응용 사진. 물리적 제품 형상은 보이지만 368택셀 장갑 사양, 보정 또는 정책 성능을 검증하지 않는다. 출처: Moxian Technology 공식 제품 페이지, https://www.moxiantech.com/robot-scene/14, 학술 리뷰 목적 공정 이용

10.4 심층 프로필 II — DexRobot

한국어 표기는 덱스로봇, 영어 브랜드는 DexRobot, 중국어 브랜드와 법인명은 灵巧智能과 浙江灵巧智能科技有限公司다. 공식 개인정보 정책이 법인명을 확인한다 [8]. 현재 WRC 페이지는 2024년 설립을 밝히고, 주최 측 자료는 저장성 사오싱시 신창과 회사를 연결한다 [9]. 포착한 회사 페이지에는 정식 ‘본사’ 표기가 없으므로 신창을 공개된 설립·등록 위치로 기록하며 본사로 승격하지 않는다.

대표 제품은 DexHand021 제품군, DexCap 웨어러블 외골격, DexTac 시뮬레이션 프레임워크, DexCanvas 데이터셋, 통합 영리 조작 솔루션이다 [6] [7]. 양산형 손 페이지는 19자유도, 위치·법선 힘·접선 힘·근접·온도 감지, CAN FD, Python/C++/ROS 통합을 제시한다. 이는 발행사의 실험실 사양이며 자율 VLA 성공률은 아니다.

DexRobot은 DexCap이 65자유도, 4.2kg 무게, 유선 최대 1,000Hz와 무선 200Hz 통신을 제공한다고 보고한다. 같은 1차 페이지는 사용 시간을 약 8시간과 8~12시간 범위로 함께 제시하므로 이 값은 해결되지 않은 발행사 페이지 내부 충돌로 유지한다 [7]. 말단 위치 오차도 X/Y 0.5mm 이하, Z 0.1mm 이하라고 밝힌다. 이 값은 좌표계, 보정, 운동 영역, 신뢰 구간, 시험 절차가 있어야 비교할 수 있다. 인코더 주기는 종단간 원격조작 지연시간이나 로봇 과제 정확도가 아니다.

DexCap은 사람 움직임과 명령 기준을 제공한다. DexHand는 촉각·고유수용 상태를 가진 대상 신체다. 리타기팅이 둘을 연결하고 학습 정책은 시연을 모방할 수 있다. 이는 영리 조작 모델에 강한 데이터 경로지만, 공개 페이지는 사람 움직임을 능동·수동 로봇 관절에 어떻게 대응하는지, 불가능한 자세를 어떻게 처리하는지, 작업자 접촉 힘도 수집하는지, 중단 시연을 어떻게 라벨링하는지 밝히지 않는다.

행동 경계는 일부 보인다. DexHand는 CAN FD와 저수준 개발 지원을 공개하며, 발행사는 동작 매핑, 원격조작, 강화학습, 모방학습, 시뮬레이션, ROS 통합을 열거한다. 그러나 고정 가중치, 정의된 관측 텐서, 행동 어휘, 추론 주기, 제어 분할, 공장 복구 정책을 가진 단일 범용 VLA는 공개 근거에서 확인되지 않는다. 따라서 판매 중인 하드웨어와 데이터·개발 기반으로 분류하며 재현 가능한 파운데이션 모델 결과로 분류하지 않는다.

SDK 성숙도는 Moxian보다 높다. Python, C++, ROS, 저수준 API, 통신 인터페이스, 시뮬레이션 모델, 데이터 자산이 명시되어 있기 때문이다 [6]. 하지만 자산별 개방 정도는 다르다. ‘오픈소스 생태계’라는 문구만으로 펌웨어, 학습 코드, 가중치, 데이터셋 라이선스, 빌드가 공개되었다고 볼 수 없다. Isaac 지원도 확인되지 않았다. 버전 정책, 릴리스 해시, 의존성 고정, 장기 API 호환성은 미검증이다.

현재 WRC 2026 페이지는 DexRobot을 B415 부스에 배치하고 DexHand021 변형, DexCap, Dexele를 열거한다 [9]. 과거 영문 주최 측 경로에는 다른 부스 번호가 남아 있으므로 방문자는 최신 디렉터리를 다시 확인해야 한다. 주최 측 등재는 참가와 전시 제품을 확인할 뿐 성공률이나 양산 물량을 검증하지 않는다.

인정된 1차 자료에서 재무는 미공개다. 발행사는 DexHand021을 양산 제품이라 부르고 주최 측도 생산 제품군을 소개한다. 출하 대수, 유료 고객, 매출, 매출총이익, 보증 반품률, 반복 소프트웨어·데이터 매출은 공개되지 않았다. 응용 사례는 견인력 신호지만 동일 조건의 공장 가동률, 사이클 시간, 개입, 폐기, 투자수익 데이터는 없다.

미디어 코퍼스 가시성은 미측정이다. 강점은 손-수집-시뮬레이션-데이터가 이어지는 구조, 자세한 하드웨어 사양, 촉각 관측, 고주기 웨어러블 수집, 명시된 개발 인터페이스다. 한계는 불완전한 개방성, 발행사 정의 정확도·내구성, 불명확한 사람-로봇 행동 의미, 공개 범용 모델 벤치마크 부재, 감사된 공장 경제성 부재다. 신뢰도는 정체성, 사양의 발행사 주장, 인터페이스 범주, WRC 등재에 높음, 생산 성숙도에 중간, VLA 범용성, 배치 성공, 재무, 외부 재현성에 낮음이다.

DexCap 공식 페이지의 아래 정지 화면은 실제 웨어러블 캡처 하드웨어를 확인하는 데 유용하다. 다만 목표 DexHand, 리타기팅 경로, 종단간 지연시간은 보이지 않으므로 자율 정책 성능이나 발행사 표기 전송률을 검증하는 증거로 읽지 않는다.

Figure 10.2: 검은 장갑 위에 착용한 DexCap 외골격을 보여 주는 DexRobot 공식 제품 영상 정지 화면. 실제 캡처 하드웨어는 확인하지만 목표 DexHand, 리타기팅, 종단간 지연시간 또는 정책 성능을 입증하지 않는다. 출처: DexRobot DexCap 공식 페이지, https://www.dex-robot.com/en/dexCap, 학술 리뷰 목적 공정 이용

10.5 심층 프로필 III — AI² Robotics

한국어 표기는 에이아이 스퀘어드 로보틱스, 영어 브랜드는 AI² Robotics, 중국어 브랜드는 智平方다. 현재 공식 사이트 하단과 WRC 페이지는 智平方(深圳)科技股份有限公司를 사용하고, 이전 개인정보 정책은 사이트 운영자를 智平方(深圳)科技有限公司로 적는다 [10] [15]. 회사는 2023년 4월 설립을 밝힌다. 인용한 공식 성명은 선전과 베이징 위치를 언급하지만 본사·하드웨어·AI 기능을 사무소별로 배정하는 근거는 제공하지 않는다 [13].

대표 제품은 AlphaBot 제품군, AlphaBot 2 휠형 양팔 플랫폼, AlphaBrain 체화 파운데이션 모델, GOVLA 구조, FiS-VLA 오픈소스 공개, AlphaBotCore SDK, VR·외골격 원격조작 체계다 [10] [11] [12]. 세 프로필 가운데 모델에서 하드웨어까지 가장 넓은 통합 스택을 주장한다.

발행사는 AlphaBrain이 전공간 이해, 전신 협응, 복합 과제 추론을 결합한다고 설명한다. AlphaBot 2 문서는 휠형 양팔 몸체, NVIDIA Orin AGX 64G, 카메라와 라이다, 4~6시간 배터리를 제시한다 [12]. 회사는 팔, 섀시, 센서, 기구학, 비상 정지 감시, 그리퍼, 동기화용 Python·C++ API를 공개한다 [11]. 이는 제어 경계를 더 잘 들여다보게 하지만 AlphaBrain의 완전한 관측·행동 텐서를 공개하지는 않는다.

AI² 회사 페이지는 FiS-VLA와 π₀의 비교를 주장하지만, 포착한 근거에는 이를 재현할 1차 논문이나 조건을 맞춘 독립 감사 벤치마크가 없다 [10]. 과제 집합, 지표, 집계, π₀ 체크포인트, 데이터 예산, 로봇 신체, 적응 규칙, 시도 수, 개입 정책, 분모, 표 위치를 1차 기술 자료에서 검증하기 전에는 수치나 모델 우위를 유지할 수 없다.

관측 범위는 일부 공개됐다. 제품 문서는 RGB/RGB-D, 깊이, 관절, 팔 힘, 섀시, 동기화 센서 인터페이스를 노출하고, 회사는 공간 이해와 전신 제어를 말한다. 그러나 각 배치에서 FiS-VLA가 사용하는 정확한 카메라 이력, 언어 형식, 촉각 입력, 고유수용 정규화, 작업지시 맥락, 품질 신호는 확인되지 않는다.

행동과 지연시간도 일부만 보인다. AlphaBotCore는 동작·기구학 호출을 제공하고, 팔 문서에는 정지, 일시 정지, 재개, 충돌 관련 검사, 힘 제어 동작이 있다. 이는 모델 아래에 기존 제어 기능이 존재한다는 유용한 근거다. 그러나 VLA가 관절 목표, 말단 변화량, 행동 덩어리, 스킬, 목표 가운데 무엇을 내는지, 추론 분포와 연산 폴백, 패킷 손실 반응, 제안 주기는 공개하지 않는다.

복구는 배치 수준에서 미공개다. 공식 자료는 장기 과제와 데이터 피드백을 설명하지만 첫 시도 성공, 재시도 횟수, 원격 개입, 평균 복구 시간, 부품 격리, 작업자 부담을 보고하지 않는다. 자동차 검사·조립·이송 사례는 의도된 공장 범위를 보여주는 주최 측 근거이지 감사된 생산 연구가 아니다 [16].

개방성은 혼합형이다. FiS-VLA는 오픈소스로 설명되고 하드웨어 문서는 상세한 Python·C++ 인터페이스를 제공한다. 그러나 모든 학습 데이터, 전처리, 체크포인트, 평가 스크립트, 배치 런타임, 공장 적응 레시피가 공개됐다는 근거는 없다. ROS와 Isaac 통합도 확인되지 않았다. 그러므로 재현성은 부분적이다. 인터페이스 수준 재현 가능성은 전체 학습이나 보고 성능 재현보다 높다.

회사는 2025년 3월 1억 위안을 넘는 Pre-A+ 라운드를 발표했고, 그해 첫 두 달에 두 번의 투자를 마쳤다고 밝혔다 [14]. 이는 발행사가 공개한 재무 사건이며 감사 현금, 기업가치, 매출은 아니다. 자동차, 반도체, 바이오 제조, 공공서비스, 소매 배치를 보고하지만 고객명, 설치 대수, 유료 생산 시간, 이용률, 갱신, 마진, 모델 기여 절감액은 미공개다.

WRC 2026 상태는 C306 부스로 주최 측 검증이 있다 [15]. 미디어 코퍼스 가시성은 미측정이다. 성숙도는 배치 주장과 개발자 문서를 갖춘 통합 판매 플랫폼이지만 파일럿, 주문, 설치, 안정 생산의 차이는 공개 자료에서 조정되지 않았다.

강점은 모델·로봇·데이터·SDK·배치 서사가 통합되어 있고, 로봇 API가 비교적 잘 보이며, 전신 플랫폼으로 제어 경계를 시험할 수 있다는 점이다. 한계는 재현 가능하고 조건을 맞춘 벤치마크가 없는 발행사 한정 비교 근거, 불완전한 모델·데이터 재현성, 미공개 지연시간과 복구, 비공개 공장 증거, 사유 데이터 의존성이다. 신뢰도는 정체성, 설립, 위치, 제품, SDK, 투자 사건, WRC 참가에 높음, 성숙도에 중간, 범용성과 공장 효익에 낮음~중간이다.

아래 이미지는 WRC 주최 측이 AI² Robotics의 자동차 제조 사례에 게시한 실물 AlphaBot 2 공장 사진이다. 로봇, 말단장치, 작업 셀의 물리적 배치는 확인하지만 자율성, 사이클타임, 성공률 또는 안정 생산을 검증하지 않는다.

Figure 10.3: 자동차 공장 작업 셀에서 부품 랙에 팔을 뻗은 실물 AlphaBot 2를 보여 주는 WRC 주최 측 AI² Robotics 사례 사진. 물리적 플랫폼과 작업 맥락은 확인하지만 자율성, 사이클타임, 성공률 또는 안정 생산을 검증하지 않는다. 출처: World Robot Conference 공식 AI² Robotics 사례 페이지, https://www.worldrobotconference.com/expo/case/23.html, 주최 측 사례 사진·학술 리뷰 목적 공정 이용

10.6 같은 척도의 프로필 비교

범용 VLA를 비교할 때는 모델, 데이터, 행동, 제어기, 개방성, 미관측 과제의 정의를 보존해야 한다 [22] [23] [24] [25]. 이 항목이 빠지면 ‘범용’, ‘개방’, ‘제로샷’이 서로 다른 실험을 가리킨다. 다음 표는 추정 능력이 아니라 공개 상태를 비교한다.

항목 Moxian Technology DexRobot AI² Robotics
KO / EN / CN 목시안 테크놀로지 / Moxian Technology / 墨现科技 덱스로봇 / DexRobot / 灵巧智能 에이아이 스퀘어드 로보틱스 / AI² Robotics / 智平方
설립 / 위치 2021 / 둥관 2024 / 신창 설립·등록 위치, 본사 표기 미공개 2023.4 / 선전·베이징 위치, 사무소별 기능 분담 미검증
대표 제품 압력 배열, 전자피부, 368택셀 장갑 DexHand021, DexCap, DexTac, DexCanvas AlphaBot 2, AlphaBrain, FiS-VLA, SDK
모델 루프 역할 촉각 관측과 수집 신체, 촉각 행동 말단, 수집·시뮬레이션 VLA·로봇·데이터·배치 통합
SDK / ROS / Isaac 미검증 / 미검증 / 미검증 Python·C++; ROS 명시; Isaac 미검증 Python·C++; ROS·Isaac 미검증
재무 / 견인력 재무 미공개; 발행사 500+ 고객 재무·비교 출하 미공개; 양산 주장 발행사 Pre-A+ 1억 위안 초과; 배치 주장
WRC 2026 주최 측 장갑 전시 주최 측 B415 주최 측 C306
재현성 센서 통합 공개 문서 부족 하드웨어·인터페이스 일부 공개 SDK·모델 일부 공개, 데이터·런타임 불완전

10.7 VLA 계보와 범용성의 의미

OpenVLA는 70억 파라미터 개방형 VLA로 가중치와 적응 코드를 공개하면 접근성을 넓힐 수 있음을 보였다 [22]. Octo는 이질적인 로봇 데이터에 걸쳐 개방형 범용 정책을 학습한다 [23]. π₀는 흐름 기반 행동 전문가로 여러 신체를 다룬다 [24]. π₀.₇은 하위과제 명령, 목표 이미지, 품질 라벨, 제어 모드 라벨 같은 조종 가능한 맥락을 더한다 [25]. 하지만 각 연구가 말하는 개방성과 범용성은 다르다.

가중치만 공개하면 추론과 미세조정은 가능하지만 전체 재현은 아니다. 보정이 빠진 데이터는 관측을 재현하지 못할 수 있다. 원래 로봇, 지그, 평가 노동이 없는 코드는 성공을 재현하지 못할 수 있다. 두 팔 사이에 전이한 모델도 이동 베이스가 시점, 도달 가능성, 타이밍을 바꾸면 실패할 수 있다. 범용성은 과제, 물체, 장면, 신체, 센서, 제어기, 적응 예산의 행렬이다.

‘보지 못한 과제’라는 라벨은 특히 약하다. 언어 명령이 새로워도 동작은 익숙할 수 있다. 물체 인스턴스가 새로워도 범주는 웹이나 로봇 데이터에 있었을 수 있다. 로봇-과제 조합이 새로워도 둘은 따로 나타났을 수 있다. 대규모 사유 혼합 데이터는 겹침 감사를 어렵게 한다. π₀.₇은 관측 과제와 새로운 조합에서 강한 결과를 보고하지만 제로샷은 더 낮고 겹침 배제도 어렵다 [25].

조달 단계에서는 새로움을 명시적으로 정의해야 한다. 형상, 재료, 부품군, 지그, 조명, 공구, 로봇, 제어기, 명령이 학습·적응 안팎 어디에 있는지 기록한다. 대상 셀 데이터 사용량도 보고한다. 엔지니어가 임계값을 조정하고 프롬프트를 다시 쓰고 성공 체크포인트를 고른 뒤의 ‘제로샷’은 사람 적응이 0인 결과가 아니다.

10.8 월드모델: 예측은 제어가 아니다

월드모델은 현재 상태와 때로는 행동을 조건으로 미래 상태의 표현을 예측한다. 계획, 반사실 시험, 데이터 생성, 표현 학습에 쓸 수 있다. 그럴듯한 영상도 형상, 접촉, 타이밍, 실패 순서를 어길 수 있다. 공장 가치는 의사결정을 지배하는 변수를 예측이 보존할 때 생긴다.

DreamDojo는 대규모 1인칭 사람 영상과 로봇 후학습을 사용해 범용 로봇 월드-행동 모델을 구축한다 [26]. 규모는 사람 영상이 행동 라벨이 붙은 로봇 데이터 외의 구조를 제공할 수 있음을 보여준다. 그러나 전이는 사람 관측과 로봇 행동 정렬, 예측 동역학 검증에 달려 있다. 손이 한 프레임 동안 물체를 통과하는 현상은 영상상 사소해도 물리적으로 치명적이다.

월드모델은 여러 층에서 작동한다. 픽셀 예측은 시각 결과를 예상한다. 잠재 동역학은 모든 세부를 렌더링하지 않고 계획을 돕는다. 객체 중심 모델은 부품과 관계를 추적한다. 접촉 인지 모델은 힘과 미끄러짐을 추정한다. 보편적으로 최적인 표현은 없다. 충돌 회피에는 형상, 삽입에는 접촉, 품질 예측에는 공정 신호, 경로 계획에는 점유와 시간이 필요하다.

SimFoundry는 시뮬레이션이 실제 정책 순위를 예측하는지 시험하고 공개된 과제·정책에 대해 상관과 순위 후회 지표를 보고한다 [27]. SIMPLER도 시뮬레이션의 가치가 실제 성능과의 대응에 달린 평가 도구로 다룬다 [28]. 중요한 지표는 렌더링의 아름다움이 아니라 가상 시험이 비싼 실물 시험과 같은 공학 결정을 이끄는지다.

10.9 지연시간, 제어 경계, 복구

Gemini Robotics는 지연시간을 다루는 한 구조를 보여준다. 클라우드 지향 백본과 로컬 행동 디코더를 나누고, 응답 최적화와 로컬 보상을 기술한다 [29]. 핵심 교훈은 구조적이다. 느린 의미 추론이 빠른 로컬 정책을 안내할 수 있고, 서보와 안전 기능은 더 빠르고 독립적인 권한을 유지한다. 하나의 모델 이름이 이 계층을 지우지 않는다.

행동 청킹은 여러 미래 명령을 한 번에 생성한다. FAST는 VLA 학습 효율을 높이도록 행동 시퀀스를 압축한다 [30]. 청킹은 동작을 매끄럽게 하고 추론 호출을 줄이지만 약정 위험을 만든다. 덩어리 중간에 장면이 바뀌면 취소 규칙이 필요하다. 평가는 덩어리 길이, 재계획 주기, 관측 중첩, 정지 지연, 로컬 제어기의 중단 가능 여부를 밝혀야 한다.

경계는 권한 표로 그려야 한다. VLA는 목표나 궤적을 제안한다. 모션 계층은 기구학과 충돌을 강제한다. 힘 제어기는 접촉을 담당한다. 안전 제어기는 인증 장치를 감시한다. PLC는 설비 상태를 중재한다. 작업자는 보호 고장 뒤 재시작을 소유한다. 학습 모델이 경계를 건너뛴다면 무엇이 그 기능을 대체하는지 써야 한다.

복구에는 예산이 필요하다. 로봇은 지각을 재시도하고, 후퇴해 다시 잡고, 사람 지도를 요청하고, 부품을 격리하거나 셀을 멈출 수 있다. 무한 재시도는 사이클을 늘리고 하드웨어를 손상시킨다. 조용한 계속 실행은 품질을 오염시킨다. 첫 시도 성공, 제한 복구 뒤 성공, 100사이클당 개입, 차단된 위험 제안, 거짓 성공, 평균 복구 시간, 복구 중 폐기를 함께 측정해야 한다.

10.10 사유 데이터 의존성과 재현성

로봇 정책은 공장이 공개하기 어려운 데이터에 의존한다. 제품 도면, 셀 영상, 공정 레시피, 결함 사례, 작업자 영상, 사이클 기록, 실패 로그다. 이런 사유 데이터는 실제 우위의 원천이지만 근거 해석을 어렵게 한다. 결정적 코퍼스와 시험 셀이 비공개이기 때문에 외부 그룹이 재현할 수 없는 강한 결과를 판매사가 정직하게 보고할 수도 있다.

공개 가중치는 개방성 사다리의 한 칸일 뿐이다. 더 강한 공개는 구조, 가중치, 행동 코덱, 학습 코드, 데이터 목록, 전처리, 보정, 평가 스크립트, 로봇 어댑터, 제어 파라미터, 시도 로그, 리셋 판단, 라이선스를 포함한다. 구매자가 모든 자산의 공공 공개를 요구할 필요는 없지만, 어느 층을 내부에서 재현할 수 있고 어느 층이 관리형 서비스에 의존하는지 알아야 한다.

사유 데이터는 업그레이드 위험도 바꾼다. 판매사가 고객 데이터를 합쳐 재학습한다면 계약은 소유권, 동의, 격리, 보존, 삭제, 파생 가중치, 고객 간 전이를 정의해야 한다. 현장 내부 학습이면 연산, 패치, 모델 롤백이 공장 책임이 된다. 클라우드 추론이나 로그는 장애, 지연, 수출 통제, 사이버보안, 사고 대응을 인수 조건에 더한다.

각 평가 에피소드는 모델 버전, 적응 데이터, 보정, 프롬프트, 제어기, 하드웨어 개정, 리셋 규칙으로 이어져야 한다. 그렇지 않으면 업데이트가 한 과제를 개선하며 다른 과제를 조용히 퇴행시킬 수 있다. 물리 배치에는 모델 이름이 아니라 릴리스 산출물과 시험 기록이 필요하다.

Figure 10.4: 언어·영상 관측 토큰, transformer, 행동 헤드, 새 신체 미세조정 경로를 연결한 Octo 구조. 이 그림은 범용 정책의 인터페이스를 보여 주지만 세 프로필 회사의 배치 성능을 입증하지 않는다. 출처: Octo Model Team et al. 2024, arXiv:2405.12213v2 Fig. 0

10.11 증거 층위: 시연, 파일럿, 생산

회사 영상은 편집 조건이 공개됐다면 설정된 시스템이 적어도 한 번 화면의 동작을 만들었다는 직접 증거다. 성공 확률의 증거로는 약하다. 제품 페이지는 발행사가 무엇을 제공하고 주장하는지 보여준다. 주최 측 자료는 행사 참가와 전시 내용을 확인한다. 논문은 방법과 통제 시험을 공개할 수 있다. 구매자 인수 시험은 구매자의 공정에 가장 강한 증거다.

공장 근거에는 분모가 필요하다. 연속 몇 사이클을 시도했는가? 실패 접근은 편집됐는가? 누가 물체를 리셋했는가? 작업자가 파지를 골랐거나 계획을 승인하거나 복구를 원격조작했는가? 부품 공차는 생산을 대표했는가? 사이클 시간은 배정부터 검증 완료까지인가? 결과가 MES에 들어갔는가?

양산과 출하는 다르다. 출하된 센서나 로봇은 연구실, 통합 프로젝트, 멈춘 파일럿에 남을 수 있다. 배치와 일상 사용도 다르다. 일상 사용도 이용률이 낮거나 지원 비용이 높으면 경제 가치가 없을 수 있다. 증거 사다리는 부품 사양, 통합 시연, 통제 벤치마크, 고객 파일럿, 인수 운전, 지속 생산, 여러 현장의 반복 배치 순이다.

AutoRT는 조율 근거가 필요한 이유를 보여준다. 53대 로봇이 7개월 동안 77,000개 에피소드를 수집했지만, 안전은 파운데이션 모델 지침뿐 아니라 기존 제어와 사람 감독에 의존했다 [31]. BUMBLE은 건물 전체의 장기 과제를 보고하지만 성공률과 개입 수치는 오류가 어떻게 누적되는지 보여준다 [32]. 신체, 환경, 과제, 안전 가정이 맞지 않으면 어느 결과도 공장에 전이할 수 없다.

10.12 제조 워크스루: 혼류 커넥터 삽입

네 종류의 전기 커넥터를 변형별 하우징에 삽입하는 라인을 생각해 보자. 기존 자동화는 지그, 레시피 자세, 순응 삽입, 힘 임계값, 비전 확인을 쓴다. 통제된 상태에서는 잘 작동하지만 형상이나 트레이 배치가 바뀌면 엔지니어링이 늘어난다. 목표는 ‘PLC 교체’가 아니라 품질을 해치지 않고 전환과 예외 비용을 줄이는 것이다.

1단계 — 기준선을 고정한다. 초회 합격률, 사이클 시간 분포, 개입, 거짓 합격, 손상, 전환 엔지니어링 시간, 정지를 측정한다. 공차, 조명, 지그 마모, 작업자 책임을 기록한다. 기준선이 없으면 유연성에는 경제적 대조군이 없다.

2단계 — 관측을 정의한다. 보정된 손목·전경 카메라, 로봇 상태, 힘-토크, 그리퍼 상태, 레시피 ID, 지그 상태를 쓴다. 촉각을 평가하면 각 택셀을 보정 단위로 매핑하고 시간을 정렬하며 죽은 채널을 기록한다. Moxian 유형 배열은 접촉 피복을, DexHand 유형 말단은 손끝 다중모달 상태를 더할 수 있다. 동기화·교체 시험을 통과하기 전에는 정책에 넣지 않는다.

3단계 — 행동과 경계를 정한다. VLA는 커넥터 식별, 삽입 전 자세, 파지, 접근을 제안한다. 관절 보간, 충돌 회피, 속도 한계, 접촉 제어, 안전 정지, 설비 핸드셰이크는 결정론 계층에 남긴다. 정책은 지그를 풀거나 품질을 선언할 수 없다. 검증 센서 규칙과 PLC 상태가 완료를 소유한다.

4단계 — 데이터 분할을 만든다. 생산 로트, 하우징 변형, 조명, 날짜를 분리한다. 커넥터-지그 조합 하나는 진짜 전이 시험용으로 남긴다. 성공 시연뿐 아니라 실패와 작업자 교정도 저장한다. 사전학습에 비슷한 커넥터가 있었을 가능성을 기록한다. 대상 셀 사유 데이터는 버전과 접근 권한을 관리한다.

5단계 — 그림자 모드를 실행한다. 모델은 사이클을 관측하고 행동을 제안하지만 권한은 없다. 제안을 실제 기준 동작과 비교하고 위험하거나 실행 불가능한 명령을 찾는다. 추론 나이, 누락 관측, 불일치, 신뢰도 보정을 측정한다. 그림자 모드는 하드웨어를 위험에 빠뜨리지 않고 통합 결함을 드러낸다.

6단계 — 제한된 권한을 준다. 저속, 격리 교대조, 훈련된 감독, 희생 부품, 1회 시도로 시작한다. 기존 제어기가 도달 가능성과 접촉 영역을 검사한다. 비정상 힘이면 검증된 경로로 후퇴하고 부품을 격리한다. 복구가 별도 승인되지 않았다면 즉흥 재삽입을 허용하지 않는다.

7단계 — 전이를 시험한다. 남겨 둔 변형, 허용 자세 오차, 반사, 마모 지그, 네트워크 저하를 넣는다. 무적응, 소량 적응, 레시피 기준선을 비교한다. 범용성은 대상 데이터나 엔지니어링을 줄이면서 인수 영역을 유지할 때만 가치가 있다.

8단계 — 승격하고 감시한다. 연속 사이클 신뢰 구간, 미해결 안전 사건 0건, 추적 가능한 버전, 허용 복구 시간, 롤백 이미지를 요구한다. 릴리스 뒤에는 분포 이동, 개입, 차단 명령, 품질 유출을 감시한다. 재학습은 보이지 않는 업데이트가 아니라 통제된 엔지니어링 변경이다.

관문 통과 증거 실패 대응
관측 모달리티 동기화, 촉각·힘 보정, 누락 경보 정지 권한 또는 기준선 폴백
행동 단위·좌표 시험, 모든 제안 검사 행동 거부와 사유 기록
성능 수율·사이클 시간이 합의 구간 충족 파일럿 연장 또는 영역 축소
복구 제한 후퇴와 격리 검증 셀 정지, 작업자 재시작
거버넌스 모델·데이터·프롬프트·어댑터 추적 승격 차단
경제성 전환 이득이 연산·지원·정지 비용 초과 기존 자동화 유지

10.13 숨은 스택을 드러내는 조달 질문

판매사에 원시 센서 타임스탬프부터 제어기에 전달된 행동까지 한 과제를 재생해 달라고 요청한다. 텐서 모양, 단위, 좌표계, 행동 지평, 지연시간 분포, 연산 위치, 폴백을 요구한다. 어느 관측이 필수이고 어느 관측이 빠져도 성능이 점진적으로 낮아지는지 묻는다. 실시간 추적은 구조를 수식하는 형용사보다 유용하다.

리셋 원장을 요청한다. 몇 번 시도했고, 무엇을 제외했으며, 누가 왜 개입했는가? 첫 시도 성공과 복구 뒤 성공을 나눠 요구한다. 거짓 성공을 어떻게 찾는지, 품질 검사가 정책과 독립적인지 묻는다. 장기 과제는 최종 숫자 하나가 아니라 하위과제별 실패 나무를 요구한다.

개방성은 자산별로 묻는다. ‘오픈소스’를 가중치, 코드, 데이터, SDK, 펌웨어, 시뮬레이터, 평가, 라이선스로 분해한다. 공개 체크포인트가 판매 로봇에서 실행되는지, 공개 어댑터가 생산 어댑터와 같은지 확인한다. 시연을 만든 적 없는 엔지니어의 독립 재현을 요청한다.

사유 데이터 경계를 묻는다. 판매사가 구매자 영상을 학습할 수 있는가? 어디에 저장하는가? 공유 가중치에 들어가는가? 삭제할 수 있는가? 라벨과 실패 로그는 누가 소유하는가? 계약이 끝나면 어떻게 되는가? 이식성은 기계 플랜지뿐 아니라 데이터 스키마와 제어기 인터페이스를 포함한다.

마지막으로 같은 기준선을 요구한다. 최선의 기존 프로그램, 모듈식 학습 스킬 시스템, 제안 VLA를 같은 부품, 교대조, 작업자, 리셋 규칙으로 비교한다. 성공뿐 아니라 엔지니어링 시간도 보고한다. 가장 강한 사업 사례는 헤드라인 정확도가 아니라 빠른 커미셔닝이나 넓은 예외 대응일 수 있다.

10.14 한계와 열린 질문

세 프로필은 의도적으로 비대칭이다. Moxian과 DexRobot은 여러 모델에 공급될 수 있는 관측·신체·데이터 기반을 제공하고, AI²는 직접적인 통합 VLA를 주장한다. 이 장은 세 회사를 대체재로 순위화하지 않는다. 각 공개 계층을 통합하고 검증할 수 있는지를 묻는다.

회사 사양은 주최 측이나 독립 시험을 따로 밝히지 않는 한 발행사 근거다. WRC 페이지는 등재와 전시를 확인하지만 성능은 검증하지 않는다. 투자 발표는 라운드 발표를 확인할 뿐 기업가치, 실제 현금, 매출, 지급 능력을 증명하지 않는다. 고객과 배치 언어에도 공통 분모가 없다.

연구 문헌도 경계가 있다. 과제, 로봇, 행동 공간, 적응 예산, 리셋, 데이터 혼합이 다르다. 닫힌 코퍼스는 중복 감사를 어렵게 한다. 개방형 모델도 비싼 사유 로봇 데이터와 하드웨어별 조정에 의존할 수 있다. 평균은 안전상 중요한 꼬리 위험을 가릴 수 있다.

월드모델 평가도 아직 정착되지 않았다. 픽셀 그럴듯함, 잠재 예측, 정책 순위, 계획 효익, 실제 성공은 다른 지표다. 접촉, 변형, 마모, 사람 행동은 여전히 어렵다. 모델은 완전한 시뮬레이터가 아니어도 제한된 결정 영역에서 유용할 수 있다.

열린 질문은 변하는 학습 부품을 어떻게 인증할지, 과제 간 퇴행을 어떻게 격리할지, 기계 수명 동안 데이터와 추론 비용을 어떻게 계산할지, 고객 기밀을 지키며 범용성을 어떻게 높일지, 공정을 노출하지 않고 실패를 어떻게 공유할지다. 단기 해법은 엄격한 경계, 버전이 붙은 증거, 보수적 승격이다.

기존 서베이와의 관계

로봇 동작, 촉각 손, 피지컬 AI에 관한 기존 서베이는 이 장 아래의 구성요소를 설명한다. 여기서는 상업·구조 관점에서 모델 주장을 센서, 행동, 제어기, 안전, 복구, 공장 근거에 연결한다. 기초 논문은 비교 축을 정의할 뿐 특정 회사가 공개하지 않은 방법을 구현한다고 암시하지 않는다.

다음에 배울 것

11장은 범용 지능 주장부터 의료, 소비자, 특수 로봇으로 이동한다. 이 시장에서는 임상 규제, 가정 지원, 개인정보, 단위 경제성, 좁은 과제 신뢰성이 범용성보다 중요할 수 있다. 같은 모델 계약을 가져가되 안전 권한, 구매자, 배치의 정의가 달라진다는 점을 확인한다.

참고문헌

  1. World Robot Conference (2026a). Moxian Technology와 촉각 데이터 수집 장갑 전시. 공식 주최 측 자료.
  2. Moxian Technology (2025). 공식 회사·제품 브로슈어. 설립과 회사 범위 자료.
  3. Moxian Technology (2026a). 공식 연락처. 법인명과 둥관 주소.
  4. Moxian Technology (2026b). 인형 로봇 전자피부. 공식 제품 자료.
  5. Moxian Technology (2026c). 공식 홈페이지. 제품, 제조, 발행사 견인력 자료.
  6. DexRobot (2026a). DexHand021 양산 플랫폼. 공식 제품·인터페이스 자료.
  7. DexRobot (2026b). DexCap 웨어러블 외골격 데이터 수집 시스템. 공식 사양.
  8. DexRobot (2026c). DexRobot 개인정보 정책. 법인 자료.
  9. World Robot Conference (2026b). DexRobot 2026 전시사 프로필. 부스와 제품 주최 측 자료.
  10. AI² Robotics (2026a). AI² Robotics 회사 프로필. 정체성, 제품, 모델 주장 자료.
  11. AI² Robotics (2026b). AlphaBotCore SDK 문서. 공식 Python 인터페이스.
  12. AI² Robotics (2026c). AlphaBot 2 하드웨어 구조. 공식 로봇 구성.
  13. AI² Robotics (2025a). 회사 정체성과 위치에 관한 공식 성명. 공식 위치 자료.
  14. AI² Robotics (2025b). Pre-A+ 투자 발표. 발행사 재무 공개.
  15. World Robot Conference (2026c). AI² Robotics 2026 전시사 프로필. 부스와 AlphaBot 자료.
  16. World Robot Conference (2026d). AI² Robotics 자동차 제조 사례. 주최 측 응용 사례.
  17. Ahn, M. et al. (2022). Do As I Can, Not As I Say: Grounding Language in Robotic Affordances. CoRL; arXiv:2204.01691.
  18. Liang, J. et al. (2023). Code as Policies: Language Model Programs for Embodied Control. ICRA; arXiv:2209.07753.
  19. Brohan, A. et al. (2023a). RT-1: Robotics Transformer for Real-World Control at Scale. RSS; arXiv:2212.06817.
  20. Brohan, A. et al. (2023b). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818.
  21. Chi, C. et al. (2023). Diffusion Policy: Visuomotor Policy Learning via Action Diffusion. RSS; arXiv:2303.04137.
  22. Kim, M. J. et al. (2024). OpenVLA: An Open-Source Vision-Language-Action Model. arXiv:2406.09246.
  23. Octo Model Team (2024). Octo: An Open-Source Generalist Robot Policy. arXiv:2405.12213. 해설 #55.
  24. Black, K. et al. (2024). π₀: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164. 해설 #2 · Terry EN.
  25. Physical Intelligence et al. (2026). π₀.₇: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities. arXiv:2604.15483. 해설 #62 · Terry EN.
  26. Gao, S. et al. (2026). DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos. arXiv:2602.06949.
  27. Ranawaka, N. et al. (2026). SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation. arXiv:2606.28276. 해설 #85 · Terry EN.
  28. Li, X. et al. (2024). Evaluating Real-World Robot Manipulation Policies in Simulation. arXiv:2405.05941.
  29. Gemini Robotics Team et al. (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
  30. Pertsch, K. et al. (2025). FAST: Efficient Action Tokenization for Vision-Language-Action Models. arXiv:2501.09747.
  31. Brohan, A. et al. (2024). AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents. arXiv:2401.12963.
  32. Garrett, C. R. et al. (2024). BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation. arXiv:2410.06237.