Part I: 산업과 선별

Chapter 3: 기술 가치사슬 — 부품에서 피지컬 AI까지

집필일: 2026-08-17 최종수정일: 2026-08-17

질문과 논지

중국 로봇산업을 볼 때 가장 중요한 질문은 “누가 가장 좋은 휴머노이드를 만들었는가”가 아닙니다. 더 유용한 질문은 모터의 토크가 어떻게 안전한 관절 운동이 되고, 카메라와 촉각의 신호가 어떻게 학습 데이터가 되며, 학습된 정책이 어떻게 공장의 품질 결과로 돌아오는가입니다. 로봇은 단일 제품처럼 보이지만 실제로는 구동기, 감속기, 전력전자, 실시간 제어기, 몸체, 지각, 말단장치, 데이터 수집, 시뮬레이션, 범용 정책, 셀 통합, 운영 서비스가 연결된 시스템입니다. 어느 한 층의 성능표만 읽으면 가치가 어디에서 만들어지고 어디에서 사라지는지 놓치기 쉽습니다.

이 장의 논지는 단순합니다. 피지컬 AI(Physical AI)의 경쟁력은 특정 모델이나 부품 하나보다, 전체 기술·운영 가치사슬을 얼마나 잘 결합하고 각 인터페이스의 손실을 얼마나 빨리 측정·수정하는가에서 생깁니다. 수직 통합은 이 결합을 빠르게 할 수 있지만 모든 층을 직접 소유하는 것이 언제나 경제적인 것은 아닙니다. 반대로 모듈형 공급망은 선택권과 전문성을 제공하지만 시간 동기화, 좌표계, 행동 표현, 안전 책임, 장애 진단의 경계를 계약과 시험으로 명확히 해야 합니다.

이 장을 읽고 나면... - 로봇 가치사슬을 구동·제어·몸체·지각·접촉·데이터·시뮬레이션·모델·통합·운영의 책임 층으로 설명할 수 있습니다. - 인접 층 사이의 핵심 인터페이스와 손실 지점을 찾아낼 수 있습니다. - 수직 통합과 전문 공급망 조합의 장단점을 제조 관점에서 비교할 수 있습니다. - 범용 정책 논문의 성능과 공장 신뢰성을 혼동하지 않고 읽을 수 있습니다. - 전시회 시연을 실제 생산 후보로 평가하기 위한 질문과 증거를 설계할 수 있습니다.

3.1 제품 목록이 아니라 연결 지도

로봇 가치사슬은 흔히 “상류 부품—중류 본체—하류 응용”이라는 세 칸으로 그려집니다. 산업 지도를 처음 볼 때는 유용하지만, 학습 기반 로봇의 실제 병목을 설명하기에는 너무 거칩니다. 같은 모터와 감속기를 사용해도 전류 루프의 대역폭, 관절 온도 추정, 충돌 감지, 타임스탬프, 카메라 보정, 행동 명령의 의미가 다르면 정책의 재사용성은 크게 달라집니다. 반대로 다른 몸체라도 관측과 행동을 명시적으로 변환하고 안전 경계를 유지하면 데이터와 모델의 일부를 재사용할 수 있습니다.

따라서 이 책은 가치사슬을 구현체(embodiment), 센싱, 데이터, 시뮬레이션, 모델, 제어, 통합, 운영으로 분리해 읽습니다. 이 구분은 회계상의 산업분류가 아니라 책임과 인터페이스를 찾기 위한 분석 틀입니다. Octo와 OpenVLA는 여러 데이터와 작업을 묶는 범용 정책의 가능성을 보여주지만 [1] [2], 산업 로봇 시스템과 통합을 다룬 ISO 10218-2의 범위는 로봇 제품을 작업 셀로 만드는 책임이 별도 층에 남는다는 점을 상기시킵니다 [3]. 즉 모델 출력이 존재한다는 사실과 안전하게 생산하는 시스템이 존재한다는 사실은 같지 않습니다.

이 구분은 기업을 분류하는 방식도 바꿉니다. 기업 하나를 “휴머노이드 기업” 또는 “AI 기업”이라고 한 단어로 부르기보다, 어떤 층을 직접 설계하고 어떤 층을 파트너에게 의존하며 어떤 인터페이스까지 보증하는지 확인해야 합니다. 하드웨어를 판매하지만 제어기와 데이터 도구까지 제공할 수 있고, 모델을 공개하지만 특정 카메라·팔·말단장치의 행동 어댑터는 고객에게 남길 수도 있습니다. 같은 매출이라도 반복 소프트웨어, 부품 납품, 프로젝트 통합, 유지보수 서비스의 경제성은 서로 다릅니다.

가치사슬을 연결 지도로 보면 “병목”도 고정되지 않습니다. 연구실에서는 데이터가 부족할 수 있고, 시제품 단계에서는 발열과 배선이, 공장에서는 재설정 시간과 고장 진단이, 규모화 단계에서는 서비스 인력과 부품 공급이 병목이 됩니다. 좋은 지도는 가장 화려한 층이 아니라 현재 시스템의 처리량과 신뢰성을 제한하는 인터페이스를 가리켜야 합니다.

Figure 3.1: Octo가 언어·영상 관측을 토큰화하고 transformer와 행동 헤드로 연결하며, 미세조정 때 새 관측과 행동공간을 붙이는 구조. 범용 정책도 관측·행동 어댑터를 가진 가치사슬의 한 계층임을 보여줍니다. 출처: Octo Team et al. 2024, arXiv:2405.12213 Fig. 0, CC BY 4.0

3.2 구동기와 제어기: 지능이 물리로 번역되는 첫 경계

구동 계층은 모터, 감속기, 베어링, 브레이크, 엔코더, 토크 또는 전류 센서, 드라이브와 열 설계를 포함합니다. 카탈로그의 최대 토크는 시작점일 뿐입니다. 연속 토크, 순간 피크의 지속 시간, 백래시, 효율, 관성, 소음, 방열, 충격 내성, 수명과 조립 편차가 실제 행동 공간을 결정합니다. 휴머노이드의 무릎과 산업용 팔의 손목은 같은 정격값을 요구하지 않으며, 정밀 삽입과 빠른 보행도 같은 기어비와 제어 여유를 요구하지 않습니다.

구동기와 제어기의 인터페이스는 단순한 “토크 명령”이 아닙니다. 명령 주기, 측정 지연, 필터, 단위, 부호, 좌표축, 포화 규칙, 온도에 따른 디레이팅, 통신 손실 시 상태가 함께 정의되어야 합니다. 상위 정책이 50 Hz로 관절 목표를 내더라도 하위 전류 루프와 상태 추정기는 훨씬 빠르게 작동할 수 있습니다. 이때 상위 명령이 위치인지 속도인지 토크인지, 혹은 임피던스 목표인지에 따라 같은 궤적도 충돌 시 전혀 다른 힘을 만듭니다.

제어기는 구동기 능력을 실행 가능한 동작으로 바꿉니다. 관절 한계, 자기 충돌, 지면 접촉, 균형, 힘 제한, 속도와 가속도 제한을 실시간으로 다루며, 모델 기반 제어와 학습 정책 사이의 안전 경계를 형성합니다. 범용 정책이 행동 청크를 출력해도 그 행동을 보간하고 추종하며 중단시키는 책임은 사라지지 않습니다. 네트워크 지연, 프레임 드롭, 엔코더 이상과 과열은 언어 모델이 직접 해결할 문제가 아니라 결정론적 제어와 보호 기능이 먼저 다뤄야 할 사건입니다.

제조 구매자는 그래서 “자유도 수”보다 인터페이스 문서를 먼저 봐야 합니다. 실시간 버스는 무엇인지, 동기화된 원시 상태를 받을 수 있는지, 저수준 모드는 어디까지 열려 있는지, 보호 정지의 소유자는 누구인지, 펌웨어가 바뀌면 로그와 정책이 어떻게 영향을 받는지 확인해야 합니다. 부품 가격이 낮아도 닫힌 진단 인터페이스와 불안정한 펌웨어는 통합과 서비스 비용을 키울 수 있습니다.

3.3 몸체와 말단장치: 행동 공간은 기구가 정한다

몸체는 지능을 담는 용기가 아닙니다. 링크 길이, 질량 분포, 작업공간, 관절 배치, 케이블 경로, 배터리, 컴퓨팅, 방진·방수, 정비 접근성이 정책이 선택할 수 있는 행동을 규정합니다. 휴머노이드는 사람 환경에 대한 접근성과 전신 협응을 목표로 하지만 안정성, 에너지, 낙상 관리와 높은 자유도 제어의 비용을 부담합니다. 4족은 이동성과 지형 적응에 강점을 두며, 고정 팔은 반복 정밀도와 셀 제어를 우선합니다. AMR 위의 팔은 이동과 조작을 결합하지만 위치 오차와 진동, 무선 통신, 충전 운영을 함께 해결해야 합니다.

말단장치는 이 가치사슬에서 특별합니다. 공정과 직접 접촉하고 성공을 최종 결정하기 때문입니다. 두 손가락 그리퍼, 흡착컵, 공정 전용 툴, 다지 손은 자유도뿐 아니라 파지 안정성, 세척성, 교체 시간, 케이블과 공압, 접촉 센싱에서 다릅니다. 범용 다지 손이 흥미로운 이유는 많은 물체와 기술을 한 하드웨어에서 표현할 가능성 때문이지만, 특정 공정에서는 간단한 평행 그리퍼나 전용 지그가 더 높은 처리량과 낮은 고장을 제공할 수 있습니다.

몸체—말단장치 인터페이스에는 기계 플랜지 이상의 정보가 필요합니다. 질량과 관성, 무게중심, 공구 좌표계, 케이블 굽힘 한계, 전원과 통신, 손가락 상태, 접촉 힘, 교체 후 보정이 상위 계획과 안전 모델에 전달되어야 합니다. 핸드를 바꾸면 도달 가능성, 충돌 외형, 제동 거리, 손목 하중과 학습 데이터의 행동 의미도 바뀝니다. “플러그 앤 플레이”는 볼트 구멍이 맞는다는 뜻이 아니라 이 의미들이 시스템 전체에 자동 또는 검증 가능한 방식으로 전파된다는 뜻이어야 합니다.

3.4 시각·고유감각·촉각: 관측은 센서 수보다 시간과 의미다

지각 계층은 외부 카메라와 손목 카메라, 깊이 센서, LiDAR, 관절 엔코더, 관성센서, 힘·토크 센서, 촉각 어레이를 포함합니다. 시각은 물체와 장면의 넓은 문맥을 제공하지만 가림, 반사, 조명 변화와 접촉 내부 상태에 약합니다. 고유감각은 빠르고 안정적인 관절 상태를 제공하지만 물체가 미끄러지는지, 케이블이 걸렸는지, 표면이 눌렸는지를 직접 말하지 못합니다. 힘·토크와 촉각은 접촉을 드러내지만 장착 위치, 포화, 히스테리시스, 마모와 보정에 민감합니다.

센서 융합의 첫 문제는 표현보다 시계입니다. 영상 프레임, 관절 상태, 명령, 힘과 촉각이 다른 지연과 주기로 기록되면, 학습기는 원인과 결과를 잘못 연결할 수 있습니다. 카메라가 본 접촉보다 촉각 피크가 늦게 저장되거나, 안전 제어기가 명령을 수정했는데 데이터에는 원래 명령만 남으면 정책은 잘못된 행동-결과 관계를 배웁니다. 하드웨어 타임스탬프, 동기화 오차, 누락 규칙, 보정 버전은 센서 해상도와 같은 수준의 제품 정보가 되어야 합니다.

Figure 3.2: F-TAC Hand의 17개 시각 기반 촉각 센서 배치, 센서 모듈, 케이블 구동 손가락 구조와 관절 가동 범위. 센서 수만이 아니라 기구·배선·힘 전달·접촉 위치가 하나의 하드웨어 인터페이스임을 보여줍니다. 출처: Zhao et al. 2025, arXiv:2412.14482 Fig. 2, CC BY 4.0

촉각의 가치는 택셀 수나 공간 해상도만으로 입증되지 않으며, 미끄럼 억제, 재파지, 삽입, 손상 감소처럼 하류 과제 결과로 연결되어야 합니다. F-TAC Hand는 손 전체에 촉각을 분산한 통합 설계를 제시하고 [7], AnyTouch는 서로 다른 시각-촉각 센서의 정적·동적 표현을 함께 학습하는 문제를 다룹니다 [8]. Almeida et al.은 손가락과 손바닥의 서로 다른 촉각 배치가 손 안 물체 재지향에 미치는 영향을 분석합니다 [9]. 이 연구들은 촉각 가치사슬의 서로 다른 고리를 보여주지만, 각 논문의 장비와 과제 범위를 넘어 특정 센서 또는 기업의 산업 우월성을 증명하지는 않습니다.

실용적인 질문은 “촉각이 있는가”가 아니라 “어느 접촉을, 어느 주기로, 어느 좌표와 단위로, 어떤 실패 판단에 쓰는가”입니다. 손끝 센서는 초기 접촉과 미끄럼에 유용할 수 있고, 손바닥과 손가락 옆면은 포괄 파지와 다중 물체 조작에서 중요할 수 있습니다. 그러나 보호층의 내구성, 케이블, 오염, 교체 후 보정, 데이터 대역폭과 추론 지연이 유지보수 계획에 들어가지 않으면 고해상도 센서가 가동률을 낮출 수도 있습니다.

3.5 데이터 계층: 궤적의 수보다 계약의 완결성

로봇 데이터의 기본 단위는 영상 파일이 아니라 에피소드입니다. 하나의 에피소드는 작업 지시, 센서 관측, 로봇 상태, 정책 또는 작업자 명령, 하위 제어기의 실제 실행, 안전 개입, 성공·실패, 품질 결과, 장비와 소프트웨어 버전을 연결해야 합니다. 이 연결이 끊기면 대규모 데이터도 공정 개선에 쓰기 어렵습니다. 성공 영상은 남아 있지만 실패 이유가 없고, 관절 명령은 있지만 제어기가 포화시킨 실제 동작이 없으며, 작업 완료 표시는 있지만 downstream 불량 검사가 없을 수 있습니다.

AgiBot World Colosseo 논문은 5개 시나리오와 217개 과제에 걸쳐 100만 개가 넘는 궤적을 보고합니다 [4]. 이 수치는 대규모 수집·관리 기반이 연구 자산이 될 수 있음을 보여주지만, 논문 데이터셋의 범위가 상업 배치 수, 고객 수, 공장 가동률 또는 수익성을 증명하는 것은 아닙니다. 서로 다른 데이터셋을 비교할 때도 “trajectory”의 길이, 성공 판정, 중복, 자율·원격조작 비율, 센서 구성과 작업 난이도가 같지 않으므로 단순 개수 순위는 피해야 합니다.

데이터 인터페이스는 관측 스키마와 행동 스키마를 함께 명시해야 합니다. 7자유도 팔의 관절 위치, 말단 자세, 이산 그리퍼 명령과 양팔 휴머노이드의 전신 목표는 같은 벡터가 아닙니다. 카메라 위치와 렌즈, 좌표 프레임, 단위, 샘플링 주기, 누락 채널, 안전 필터, 리타게팅 방식이 메타데이터로 남아야 합니다. 자연어 지시도 자유 문장만 저장하기보다 작업 대상, 제약, 종료 조건과 품질 기준을 연결해야 재학습과 평가에 쓸 수 있습니다.

현장에서 가장 값진 데이터는 종종 성공보다 실패와 복구입니다. 미끄럼, 끼임, 오인식, 과열, 통신 손실, 작업자 인수, 보호 정지와 재설정은 어떤 계층이 약한지 보여줍니다. 이런 사건을 삭제하고 성공 궤적만 모으면 정책은 정상 상태를 더 잘 흉내 내지만 운영 조직은 같은 실패를 반복합니다. 데이터 권리와 모델 권리도 구분해야 합니다. 고객 공정에서 생성된 원시 데이터, 파생 특징, 모델 업데이트와 벤더 전체 모델에 대한 사용권이 각각 누구에게 있는지 계약에서 정해야 합니다.

3.6 시뮬레이션과 디지털 자산: 경험 생성기이자 인터페이스 시험대

시뮬레이션은 실제를 대체하는 한 장의 디지털 복제본이 아닙니다. 기구학과 충돌, 강체·접촉 물리, 센서 렌더링, 작업 논리, 무작위화, 정책 학습, 회귀평가가 서로 다른 정확도와 속도로 결합된 도구 묶음입니다. 보행 정책에는 병렬 물리와 접촉 안정성이 중요하고, 빈 피킹에는 카메라와 물체 외관, 정밀 삽입에는 공차·마찰·순응 모델이 중요합니다. 목적이 다르면 필요한 충실도도 달라집니다.

시뮬레이션의 입력 인터페이스는 CAD 파일 하나로 끝나지 않습니다. 질량과 관성, 관절 마찰, 모터 한계, 지연, 센서 노이즈, 재료, 충돌 형상, 제어 주기와 실패 조건을 버전 관리해야 합니다. 출력도 보상 곡선만이 아니라 실제 로봇과 비교할 수 있는 상태, 접촉, 에너지, 위반 사건과 성공 정의를 포함해야 합니다. 실제 측정으로 파라미터를 식별하고, 시뮬레이션에서 민감도를 분석한 뒤, 제한된 실물 시험으로 상관을 갱신하는 순환이 필요합니다.

시뮬레이션은 공급망 인터페이스를 조기에 시험하는 장소이기도 합니다. 손의 URDF와 드라이버가 다른지, 카메라 프레임이 바뀌었는지, 행동 어댑터가 관절 한계를 존중하는지, 정책 업데이트가 기존 실패를 되살리는지 물리 장비를 오래 점유하기 전에 검사할 수 있습니다. 그러나 가상 성공은 안전 승인이나 품질 승인과 동일하지 않습니다. 접촉 마찰, 케이블, 변형체, 센서 오염과 사람의 예측 불가능한 행동처럼 모델 밖의 현상은 실제 검증에 남습니다.

3.7 VLA와 범용 정책: 재사용 가능한 기반, 완제품은 아니다

비전-언어-행동 모델(Vision-Language-Action model, VLA)은 영상과 언어 지시를 로봇 행동에 연결합니다. 범용 정책의 경제적 약속은 작업마다 처음부터 모델을 만드는 대신, 대규모 다중 작업 데이터에서 공통 표현과 행동 구조를 학습한 뒤 적은 현장 데이터로 적응하는 것입니다. Octo는 이종 로봇 데이터를 이용한 오픈 범용 정책을 제시했고 [1], OpenVLA는 공개 7B VLA와 다중 로봇 평가를 제공했습니다 [2]. RDT-1B는 양팔 조작에 10억 파라미터 규모의 diffusion 정책을 적용한 사례입니다 [6].

이 오픈 범용 정책들은 재사용 가능한 연구 기준선을 만들지만, 그 자체로 공장 신뢰성을 입증하지는 않습니다. 논문 성능은 공개된 과제, 몸체, 데이터 분포, 평가 횟수와 성공 정의에 묶여 있습니다 [1] [2]. 생산에서는 사이클 타임의 분포, 장시간 드리프트, 부품 로트 변화, 오염, 사람과의 간섭, 안전 정지, 복구 시간, 품질 검사, 모델 업데이트와 롤백을 추가로 검증해야 합니다.

VLA와 로봇 사이에는 행동 어댑터가 있습니다. 모델이 말단 자세 델타를 출력할지 관절 목표를 출력할지, 몇 스텝을 묶을지, 그리퍼를 어떻게 표현할지, 좌우 팔과 전신의 우선순위를 어떻게 조정할지 정해야 합니다. 관측 어댑터는 카메라 순서와 해상도, 언어 템플릿, 로봇 상태와 촉각을 모델 입력에 맞춥니다. 이 어댑터는 사소한 glue code가 아니라 재현성과 안전을 좌우하는 제품 계층입니다.

접촉 과제에서는 시각과 언어만으로 부족할 수 있습니다. ForceVLA는 논문이 설정한 다섯 과제에서 힘 입력이 없는 π0-base 기준선의 평균 성공률 37.3%에 비해 60.5%를 보고했습니다. 이는 절대 23.2%포인트 차이이며, 공개된 과제 설정에서 최대 80% 성공률을 보고했습니다 [10]. 이 수치는 힘 입력이 특정 접촉 과제에서 정책 결과를 바꿀 수 있다는 근거이지만, 모든 로봇과 제조 공정에 같은 이득이 난다는 보증은 아닙니다. 센서의 위치와 대역폭, 행동 표현, 하위 힘 제어, 안전 한계가 함께 맞아야 합니다.

Figure 3.3: Open X-Embodiment 데이터셋의 로봇별 데이터셋·장면·궤적 분포와 공통 기술·물체 분포. 다양한 몸체를 한 저장소에 모아도 기여량과 장면 구성이 불균형하므로 전이 결과의 분모를 함께 확인해야 합니다. 출처: Open X-Embodiment Collaboration et al. 2023, arXiv:2310.08864 Fig. 0, CC BY 4.0

3.8 교차 구현체 전이: 공통성은 늘고 몸체 차이는 남는다

Open X-Embodiment는 여러 기관, 로봇, 과제를 모아 교차 구현체 학습의 공통 기반을 만들었습니다 [5]. 이 흐름의 중요한 공헌은 한 로봇의 데이터만으로는 얻기 어려운 시각·언어·작업 다양성을 공유할 수 있음을 보여준 데 있습니다. 그러나 “다른 몸체의 데이터를 썼다”와 “아무 몸체에나 바로 배치할 수 있다” 사이에는 큰 간격이 있습니다.

교차 구현체 데이터가 늘어도 행동 좌표, 타이밍, 센서 배치, 동역학, 접촉과 안전 인터페이스는 몸체별로 남습니다. Open X-Embodiment는 공통 데이터와 모델링의 토대를 제공하고 [5], RDT-1B는 특정한 양팔 행동 구조에서 전이를 연구합니다 [6]. 시뮬레이션 기반 교차 구현체 연구도 행동을 옮기기 위해 장면 복원, 리타게팅, 물리 최적화와 실제 검증이 필요함을 보여줍니다 [11]. 따라서 교차 구현체 성능은 원본과 목표 로봇의 센서, 자유도, 말단장치, 제어 주기와 평가 조건을 함께 공개할 때 해석할 수 있습니다.

행동 정규화는 특히 위험한 추상화입니다. 서로 다른 로봇의 관절 벡터를 같은 길이로 패딩한다고 의미가 같아지지 않습니다. 말단 자세 델타도 카메라·베이스 좌표계, 단위, 회전 표현, 시간 간격과 도달 가능성이 다릅니다. 양손 협응에서는 어느 손이 물체를 고정하고 어느 손이 조작하는지, 전신에서는 균형 제약과 접촉 순서가 추가됩니다. 데이터 변환기는 이 의미를 숨기기보다 변환 실패와 손실을 측정해야 합니다.

공급망 관점에서 교차 구현체 전이는 잠금 효과를 줄일 가능성이 있습니다. 공통 관측·행동 계약과 검증 세트가 있으면 몸체 공급자를 바꾸거나 여러 플랫폼을 운용하기 쉬워집니다. 동시에 범용 모델 공급자가 데이터 표현과 업데이트 경로를 장악하면 새로운 형태의 잠금이 생길 수 있습니다. 제조사는 원시 로그, 변환 코드, 기준 평가, 모델 버전과 롤백 경로를 확보해야 합니다.

3.9 통합과 운영: 마지막 10퍼센트가 아니라 별도 제품

통합 계층은 로봇을 특정 공정에 맞춥니다. 치공구, 컨베이어, PLC, MES, 품질 검사, 안전 장치, 네트워크, 작업자 UI, 사이클 로직과 복구 절차를 연결합니다. 연구 데모에서 성공한 정책도 부품 공급 지연, 잘못된 SKU, 공구 마모, 카메라 오염, 라인 속도 변경, 수동 모드 전환을 처리하지 못하면 생산 시스템이 아닙니다. 통합은 모델 뒤에 붙는 마지막 작업이 아니라 요구사항을 위쪽 모든 층에 되돌리는 별도 설계 활동입니다.

운영 계층은 배치 후의 가동률, 평균 수리 시간, 예비 부품, 원격 진단, 현장 서비스, 보안 패치, 모델 업데이트, 품질 추적과 작업자 교육을 소유합니다. 여기에서 기술 가치는 지속 매출 또는 지속 비용으로 바뀝니다. 좋은 모델이 한 번의 데모를 성공시키는 것과 3교대 환경에서 수개월 동안 목표 품질을 유지하는 것은 다른 능력입니다. 원격 지원이 필요할 때 고객 데이터가 어디로 이동하는지, 연결이 끊기면 어떤 기능이 남는지도 운영 설계에 포함됩니다.

ISO 10218-2의 시스템 통합 범위는 안전 책임이 완제품과 응용 셀에 걸쳐 있다는 구조를 보여주는 기반 자료입니다 [3]. 다만 2011년판은 이후 판으로 대체되었으므로 실제 규정 준수는 2026년 해당 지역에 적용되는 최신 표준, 법규와 자격 있는 안전 검토를 따라야 합니다. 이 장은 표준을 기업 평가 점수나 법률 자문으로 사용하지 않고, 부품의 안전 기능만으로 셀 안전이 완성되지 않는다는 책임 경계를 설명하는 데 사용합니다.

운영 피드백이 데이터 층으로 돌아오면 가치사슬은 선형 공급망이 아니라 폐루프가 됩니다. 실패 코드, 작업자 인수, 정지 원인, 교체 부품, 보정 변경과 품질 결과가 에피소드에 연결되어야 다음 데이터 수집과 시뮬레이션, 모델 업데이트가 실제 병목을 겨냥할 수 있습니다. 이 루프를 소유한 조직은 같은 실패의 재발 시간을 줄일 수 있지만, 텔레메트리만 모으고 릴리스 권한과 품질 책임이 분리되면 데이터 규모가 커져도 운영 학습은 느립니다.

3.10 한눈에 보는 인터페이스와 검증 질문

다음 표는 특정 기업의 순위를 매기지 않습니다. 인접 층 사이에서 무엇을 넘기고 무엇을 시험해야 하는지 보여주는 조달·실사 도구입니다.

경계 전달되는 핵심 객체 자주 숨는 손실 구매·통합 시 확인할 증거
구동기 → 제어기 위치·속도·토크·전류·온도·고장 상태 지연, 포화, 백래시, 열 디레이팅 명령/상태 주기, 연속 부하 시험, 통신 손실 동작
제어기 → 몸체 관절 목표, 전신 제약, 충돌·균형 상태 모델 오차, 유연성, 케이블, 낙상 실제 궤적 오차, 보호 정지, 복구와 한계 조건
몸체 → 말단장치 플랜지, 전원, 통신, 관성·공구 좌표 하중 변화, 배선, 교체 후 보정 도구 교체 절차, TCP 검증, 충돌 외형 갱신
몸체/환경 → 지각 영상, 깊이, 관절, IMU, 힘·촉각 가림, 드리프트, 시계 불일치, 오염 하드웨어 타임스탬프, 보정 이력, 열화·세척 시험
센서 → 데이터 동기화 관측, 품질·실패 레이블 누락 채널, 안전 수정 명령, 선택 편향 에피소드 스키마, 원시 로그, 실패와 복구 보존
데이터 → 시뮬레이션 자산, 파라미터, 분포, 실제 실패 틀린 질량·마찰, 단순 접촉, 오래된 공정 식별 근거, 실제-가상 상관, 버전과 민감도
데이터/시뮬레이션 → VLA 학습 혼합물, 관측·행동 토큰, 평가 세트 구현체 의미 손실, 누출, 불균형 데이터 계보, 몸체별 결과, 동결 평가와 실패 분석
VLA → 제어기 행동 청크, 불확실성, 중단 또는 서브골 지연, 불가능한 목표, 힘·안전 무시 행동 어댑터, 한계 필터, watchdog, fallback
통합 → 운영 셀 레시피, 안전·품질 게이트, 복구 절차 책임 공백, 업데이트 회귀, 벤더 잠금 FAT/SAT, 가동률·MTTR, 롤백, 데이터·서비스 계약
운영 → 데이터 루프 실패, 인수, 정비, 품질, 버전 정보 성공만 저장, 원인 코드 불일치 결함별 replay set, 릴리스 승인자, 재발 시간

이 표의 핵심은 “API가 있는가”보다 의미가 보존되는가입니다. 초당 100개의 메시지를 받을 수 있어도 실제 실행 명령과 시간 정렬이 안 되면 학습에는 부정확합니다. 표준 플랜지가 있어도 공구 관성과 충돌 외형이 갱신되지 않으면 계획에는 위험합니다. 모델이 여러 로봇을 지원한다고 해도 몸체별 평가와 어댑터가 공개되지 않으면 전이 비용을 추정할 수 없습니다.

3.11 수직 통합의 이익과 대가

수직 통합 기업은 구동기부터 몸체, 데이터 도구, 모델과 운영까지 여러 층을 직접 설계할 수 있습니다. 가장 큰 이익은 인터페이스 변경 속도입니다. 정책이 관절 발열을 반복해서 유발하면 하드웨어, 제어와 학습 팀이 함께 행동 공간과 냉각, 데이터 가중치를 바꿀 수 있습니다. 촉각이 중요한 실패를 발견하면 손 설계와 센서 배치, 수집 장치, 모델 입력을 공동 최적화할 수 있습니다. 부품과 소프트웨어의 버전을 함께 관리하면 재현성과 진단도 쉬워질 수 있습니다.

그러나 통합 범위가 넓을수록 자본, 재고, 인증, 제조 수율, 현장 서비스와 연구 투자를 동시에 부담합니다. 내부 부품이 시장 최고의 가격·성능을 지속해서 제공한다는 보장도 없습니다. 폐쇄형 인터페이스는 초기 데모를 빠르게 만들 수 있지만 고객의 기존 PLC, 카메라, 공구, 데이터 시스템과 연결할 때 비용이 커질 수 있습니다. 한 층의 공급 문제나 설계 결함이 전체 제품의 출시와 서비스를 지연시키는 집중 위험도 생깁니다.

전문 공급망 조합은 각 층의 최적 공급자를 선택하고 기술 변화에 따라 교체할 수 있습니다. 표준 산업용 팔, 검증된 안전 제어, 전문 비전, 공정별 그리퍼와 공개 모델을 조합하면 수율과 유지보수 경험을 활용할 수 있습니다. 대신 통합업체 또는 제조사가 좌표, 타이밍, 드라이버, 버전, 안전과 데이터 권리를 조정해야 합니다. 여러 벤더가 장애를 서로의 책임이라고 주장하면 평균 수리 시간이 길어질 수 있습니다.

따라서 “수직 통합도가 높다”는 사실을 점수처럼 쓰기보다 어떤 불확실성을 줄이는지 물어야 합니다. 고속 제품 반복과 공동 설계가 핵심이면 통합의 가치가 크고, 공정이 안정적이며 기존 자동화 자산이 많다면 모듈성과 검증된 부품 생태계가 더 중요할 수 있습니다. 좋은 구조는 모든 것을 소유하는 구조가 아니라 부하를 받는 인터페이스의 책임자와 교체 비용을 명확히 한 구조입니다.

3.12 산업용 로봇이 제공하는 기준선

피지컬 AI를 평가할 때 기준선은 사람이 모든 것을 수동으로 하는 상태만이 아닙니다. 산업용 팔, 전용 자동화, PLC, 비전 검사와 공정 지그는 이미 높은 반복성, 예측 가능한 사이클 타임, 안전 통합, 예비 부품과 유지보수 체계를 제공합니다. 새로운 휴머노이드나 VLA는 “작업을 한 번 성공했다”가 아니라 기존 시스템이 어려워하는 변동성과 재배치, 다품종 전환, 비정형 복구에서 추가 가치를 보여야 합니다.

산업 기준선은 평균 성공률보다 분포와 비용을 봅니다. 시간당 처리량, 불량과 재작업, 계획·비계획 정지, 교대조별 편차, 공구 교체, 재보정, 에너지, 작업자 개입, 안전 사건, 평균 수리 시간, 수명주기 비용을 함께 측정해야 합니다. 학습 정책이 평균 성공을 높여도 긴 꼬리 실패가 라인을 멈추거나 제품을 손상시키면 경제성이 나빠질 수 있습니다. 반대로 전용 자동화보다 사이클이 느려도 품목 전환 시간을 크게 줄이고 사람의 위험 작업을 줄이면 가치가 생길 수 있습니다.

범용 몸체와 피지컬 AI의 합리적인 초기 역할은 기존 산업 로봇을 전부 대체하는 것이 아니라 자동화가 어려웠던 틈을 채우는 것일 수 있습니다. 빈번히 바뀌는 작업, 낮은 물량, 사람이 만든 환경, 불완전한 부품 정렬, 여러 공구를 오가는 유지보수 보조가 후보입니다. 이때도 공정의 안정된 부분은 결정론적 제어와 지그에 남기고, 변동성이 큰 지각·계획·복구에 학습을 배치하는 하이브리드 구조가 실용적일 수 있습니다.

가격 비교도 인터페이스 책임을 포함해야 합니다. 부품 가격과 통합된 셀 가격, 초기 도입비와 생애주기 비용을 섞지 말고, 같은 기간·가동시간·작업 범위·지원 인력을 분모로 맞춰야 합니다. 센서→모델→제어→통합→운영의 각 경계에 문서, 테스트, 로그, 복구와 최종 책임자를 배정한 뒤에야 싸게 산 부품이 전체 시스템에서도 싸다고 말할 수 있습니다.

3.13 제조 현장에서 읽는 세 가지 사례

첫째, 커넥터 삽입 셀을 생각해 보겠습니다. 카메라는 부품과 소켓 위치를 찾고, 팔과 손목은 접근하며, 말단 힘 센서와 촉각은 초기 접촉과 걸림을 감지합니다. VLA는 작업 지시와 장면을 바탕으로 접근 전략이나 복구를 제안할 수 있지만, 하위 임피던스 제어와 힘 한계, 정지 조건이 접촉을 실행합니다. 데이터에는 명령뿐 아니라 실제 힘, 삽입 깊이, 불량 검사와 재작업이 연결되어야 합니다. 시뮬레이션은 위치와 공차, 마찰을 흔들어 후보 정책을 거르지만 실제 커넥터 변형과 손상은 실물 시험으로 확인합니다.

둘째, 혼합 빈 피킹은 시각-몸체-그리퍼 인터페이스를 드러냅니다. 물체 인식이 좋아도 팔이 접근할 수 없거나 그리퍼가 표면을 잡지 못하면 실패합니다. 흡착 압력, 턱 위치, 손목 하중과 놓기 후 검사가 하나의 에피소드에 있어야 실패 원인을 분류할 수 있습니다. 새로운 SKU가 들어오면 모델 업데이트만 할지, 그리퍼 패드를 바꿀지, 카메라 위치와 조명을 바꿀지 가치사슬 전체에서 판단해야 합니다.

셋째, 휴머노이드의 자재 이송은 이동, 균형, 양손 파지와 운영의 결합을 시험합니다. 시연 영상에서 상자를 옮겼다는 사실만으로는 충분하지 않습니다. 바닥 마찰, 문턱, 배터리, 사람 통행, 낙하 위험, 안전 거리, 수동 복구와 충전 동선이 처리량을 결정합니다. 물체를 안정적으로 들 수 있어도 교대 중 잦은 재부팅과 원격 지원이 필요하면 운영 가치는 낮습니다. 반대로 낮은 속도라도 기존 설비를 크게 바꾸지 않고 여러 위치를 오갈 수 있고 복구가 빠르다면 특정 다품종 환경에서 의미가 있을 수 있습니다.

Figure 3.4: AgiBot World Colosseo의 사람 개입형 데이터 수집 파이프라인. 유효성 검사, 품질 판정, 실패 원인 분류와 복구 피드백이 수집·처리·학습 사이를 닫는 구조이며, 궤적 수만으로는 드러나지 않는 데이터 계약을 보여줍니다. 출처: AgiBot-World Contributors et al. 2025, arXiv:2503.06669 Fig. 2, CC BY-NC-SA 4.0

이 세 사례에서 공통 질문은 “AI가 있나”가 아니라 “실패가 어느 층에서 관측되고 누가 수정하며 다음 릴리스를 무엇으로 막는가”입니다. 제조사는 PoC 시작 전에 실패 분류, 기준선, 에피소드 스키마, 안전 권한과 품질 승인자를 정해야 합니다. 그러면 데모가 성공했을 때도 무엇이 입증되었는지, 실패했을 때도 어느 인터페이스를 바꿔야 하는지 알 수 있습니다.

3.14 공개 근거의 한계와 실사 원칙

이 장이 사용하는 근거는 논문과 공식 표준의 공개 범위에 묶입니다. 논문은 새로운 방법을 비교하기 위해 제한된 로봇, 과제, 데이터, 기준선과 시험 횟수를 선택합니다. 공식 발표는 제품 범위와 자체 지표를 설명할 수 있지만 선택적으로 보고될 수 있습니다. 서로 다른 연도와 정의의 수치를 한 표에 놓는다고 비교 가능해지지 않습니다. 특히 연구 데이터 규모, 모델 파라미터, 데모 성공률을 출하량, 고객 유지, 공장 가동률이나 매출로 바꾸어 해석해서는 안 됩니다.

최신 논문의 수치도 시간 경계를 가집니다. AgiBot World, OpenVLA, Octo, RDT-1B, ForceVLA, 촉각 연구의 결과는 각 논문이 공개한 설정에서의 증거입니다. 독립 재현, 장기 운전, 안전·품질 감사와 서비스 성과가 없으면 산업 일반화는 유보해야 합니다. 동일 이름의 논문 프로젝트와 회사 또는 상용 제품도 명시적 소속·제품 근거 없이 같다고 가정하지 않습니다.

실사는 네 단계로 진행하는 편이 좋습니다. 먼저 인터페이스 문서와 원시 로그 예시를 요청합니다. 다음으로 공급자가 제시한 조건에서 데모를 재현합니다. 세 번째로 제조사가 선택한 경계 조건과 실패를 넣어 제한 시험을 합니다. 마지막으로 기존 산업 기준선과 처리량, 품질, 개입, 정지, 복구와 비용을 같은 기간·같은 정의로 비교합니다. 모델 업데이트 전후에는 동결된 replay set과 실물 승인 게이트를 사용하고, 실패 시 이전 버전으로 돌아갈 수 있어야 합니다.

이 원칙은 중국 기업을 낮게 평가하기 위한 것이 아닙니다. 오히려 빠르게 변하는 공급망에서 연구 성과, 제품 능력, 제조 능력과 운영 증거를 공정하게 분리하기 위한 것입니다. 강한 기업은 모든 층의 최고 수치를 주장하는 기업이 아니라 자신이 보증하는 경계, 파트너가 맡는 경계, 아직 검증되지 않은 경계를 명확히 설명할 수 있는 기업입니다.

3.15 제4장으로: 범용 몸체에서 인터페이스를 확인하기

가치사슬 지도는 제4장의 휴머노이드·4족 기업을 읽는 기준을 제공합니다. 다음 장에서는 몸체의 자유도와 외형만 비교하지 않고, 구동 모듈, 전신 제어, 센서와 손, 개발 도구, 데이터 수집, 모델 연결, 안전·서비스가 실제 제품 안에서 어떻게 결합되는지 살펴봅니다. 특히 발표된 데모와 반복 가능한 제품 능력, 시제품 생산과 안정된 양산, 연구 생태계와 현장 운영을 구분합니다.

제4장에서 던질 질문은 명확합니다. 이 몸체가 어떤 행동 인터페이스를 열어 두는가, 어떤 센서가 시간 동기화되어 기록되는가, 넘어짐과 접촉을 누가 제어하는가, 손과 도구를 바꾸면 모델과 안전 구성이 어떻게 갱신되는가, 고객이 자체 데이터와 평가를 소유할 수 있는가, 그리고 고장 뒤 얼마나 빨리 복구할 수 있는가입니다. 이 질문을 통과해야 “범용 몸체”가 피지컬 AI 가치사슬의 실질적 플랫폼인지 판단할 수 있습니다.

참고문헌

  1. Ghosh, D., et al. (2024). Octo: An Open-Source Generalist Robot Policy. Robotics: Science and Systems. #55 Terry 해설 · Terry EN.
  2. Kim, M. J., et al. (2024). OpenVLA: An Open-Source Vision-Language-Action Model. arXiv:2406.09246.
  3. ISO. (2011). ISO 10218-2:2011 Robots and robotic devices — Safety requirements for industrial robots — Part 2: Robot systems and integration. International Standard.
  4. AgiBot-World Contributors et al. (2025). AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems. arXiv:2503.06669.
  5. Open X-Embodiment Collaboration et al. (2023). Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv:2310.08864.
  6. Liu, S., et al. (2024). RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation. arXiv:2410.07864.
  7. Zhao, Z., et al. (2025). Embedding high-resolution touch across robotic hands enables adaptive human-like grasping. Nature Machine Intelligence. #39 Terry 해설 · Terry EN.
  8. Feng, R., et al. (2025). AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-Tactile Sensors. ICLR 2025.
  9. Almeida, J. D., Falotico, E., Laschi, C., & Santos-Victor, J. (2025). The Role of Touch: Towards Optimal Tactile Sensing Distribution in Anthropomorphic Hands for Dexterous In-Hand Manipulation. ICNSC 2025; arXiv:2509.14984. #41 Terry 해설 · Terry EN.
  10. Yu, J., et al. (2025). ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation. NeurIPS 2025; arXiv:2505.22159. #1 Terry 해설 · Terry EN.
  11. Dan, P., Kedia, K., Chao, A., Pan, E. W., & Choudhury, S. (2025). X-Sim: Cross-Embodiment Learning via Real-to-Sim-to-Real. arXiv:2505.07096.
  12. WALL-OSS authors (2026). Wall-OSS-0.5 Technical Report. arXiv:2605.30877.
  13. TeleDex authors (2026). TeleDex: Accessible Dexterous Teleoperation. arXiv:2603.17065.
  14. Tactile Genesis authors (2026). Tactile Genesis: Exploring Tactile Sensors at Scale for Learning Dexterous Tasks. arXiv:2606.22332.
  15. Robots Need More Than VLA authors (2026). Robots Need More than VLA and World Models. arXiv:2606.06556.
  16. RoboTacDex authors (2026). RoboTacDex: A Dexterous Visual-Tactile-Action Dataset for Humanoid Manipulation. arXiv:2606.31836.
  17. DexVerse authors (2026). DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation. arXiv:2607.08751.
  18. DexterCap authors (2026). DexterCap: An Affordable and Automated System for Capturing Dexterous Hand-Object Manipulation. arXiv:2601.05844.
  19. DexTele authors (2026). DexTele: A Dual-Arm Dexterous Teleoperation System Based on Motion Retargeting and Adaptive Force Control. arXiv:2607.05883.
  20. ContactWorld authors (2026). ContactWorld: What Matters in Vision-Tactile World Models for Contact-Rich Manipulation. arXiv:2606.13877.
  21. Booster Robotics research (2026). Booster Lab: A Data-Centric Pipeline for Learning Deployable Humanoid Locomotion Policies. arXiv:2606.27813.
  22. Visuo-tactile pose authors (2025). Visuo-Tactile Object Pose Estimation for Contact-Rich Manipulation. arXiv:2503.19893.
  23. OSMO authors (2025). OSMO: Open-Sourced Multi-Modal Tactile Glove for Robotic Manipulation. arXiv:2512.08920. Terry #18.
  24. Galaxea AI (2025). G0: A Generalist Robot Policy from Galaxea AI. arXiv:2509.00576.
  25. DexForce paper authors (2025). DexForce: Extracting Force-Informed Actions from Human Demonstrations. arXiv:2501.10356.
  26. Booster Robotics research (2025). Booster Gym: End-to-End Humanoid Locomotion Framework. arXiv:2506.15132.
  27. Tairan He, Zhengyi Luo, Xialin He, Wenli Xiao, Chong Zhang, Weinan Zhang, Kris Kitani, Changliu Liu, Guanya Shi (2024). OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning. arXiv:2406.08858.
  28. Zipeng Fu, Qingqing Zhao, Qi Wu, Gordon Wetzstein, Chelsea Finn (2024). HumanPlus: Humanoid Shadowing and Imitation from Humans. arXiv:2406.10454.
  29. DexGrip authors (2024). DexGrip: Robot Dexterous Grasping with Tactile Sensing. arXiv:2411.17124.
  30. BestMan authors (2024). BestMan: A Mobile Manipulator Platform for Embodied AI. arXiv:2410.13407.
  31. Tony Z. Zhao et al. (2023). Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware. arXiv:2304.13705.
  32. Z.-H. Yin et al. (2023). Rotating without Seeing: Towards In-hand Dexterity through Touch. arXiv:2303.10880.
  33. Ankur Handa et al. (2023). DeXtreme: Transfer of Agile In-hand Manipulation from Simulation to Reality. arXiv:2210.13702.
  34. Danny Driess et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  35. C. Daniel Freeman et al. (2021). Brax: A Differentiable Physics Engine for Large Scale Rigid Body Simulation. arXiv:2106.13281.
  36. Fanbo Xiang et al. (2020). SAPIEN: A SimulAted Part-based Interactive ENvironment. DOI:10.1109/cvpr42600.2020.01104.
  37. Subramanian Sundaram et al. (2019). Learning the signatures of the human grasp using a scalable tactile glove (STAG). DOI:10.1038/s41586-019-1234-z.
  38. Fabio Ramos et al. (2019). BayesSim: Adaptive Domain Randomization Via Probabilistic Inference for Robotics Simulators. DOI:10.15607/rss.2019.xv.029.
  39. OpenAI (2019). Learning Dexterous In-Hand Manipulation. DOI:10.1177/0278364919887447.
  40. Aude Billard et al. (2019). Trends and Challenges in Robot Manipulation. DOI:10.1126/science.aat8414.
  41. Patrick M. Wensing et al. (2018). Linear Matrix Inequalities for Physically Consistent Inertial Parameter Identification. DOI:10.1109/tro.2017.2769099.
  42. Cosimo Della Santina et al. (2018). Toward dexterous manipulation with augmented adaptive synergies: The Pisa/IIT SoftHand 2. DOI:10.1109/tro.2018.2830407.
  43. Silvio Traversaro et al. (2016). Identification of Fully Physical Consistent Inertial Parameters using Optimization on Manifolds. DOI:10.1109/iros.2016.7759801.
  44. Sergey Levine et al. (2016). End-to-End Training of Deep Visuomotor Policies. Journal of Machine Learning Research.
  45. David Coleman et al. (2014). Reducing the barrier to entry of complex robotic software: a MoveIt! case study. Journal of Software Engineering for Robotics.
  46. Stéphane Ross et al. (2011). A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. AISTATS 2011.
  47. Rachid Boulic et al. (2008). Real-Time Motion Retargeting to Highly Redundant Robots. DOI:10.1109/tro.2008.2001367.
  48. Jan Swevers et al. (1997). Excitation Trajectories for the Identification of Base Inertial Parameters of Robots. DOI:10.1177/027836499701600306.
  49. Richard M. Murray et al. (1994). A Mathematical Introduction to Robotic Manipulation. CRC Press.
  50. Bruno Siciliano et al. (1991). A General Framework for Managing Multiple Tasks in Highly Redundant Robotic Systems. DOI:10.1109/icar.1991.240390.
  51. Maxime Gautier (1991). A Direct and Efficient Method for Identifying the Minimum Dynamic Parameters of Robots. DOI:10.1109/robot.1991.131896.
  52. Christopher G. Atkeson et al. (1986). Estimation of Inertial Parameters of Manipulator Loads and Links. DOI:10.1177/027836498600500306.