피지컬 AI 로봇
영상 한 편이 로봇의 새 작업 지시서가 됩니다
Skild AI S1은 시범 영상 한 편을 문맥으로 읽어 처음 보는 다단계 작업을 실행합니다. NVIDIA 발표 수치는 회사 측 테스트 범위이며 실제 현장 적용에는 독립 검증과 안전 설계가 필요합니다.
이 글에서 다룰 내용
S1의 인컨텍스트 러닝 원리, NVIDIA Isaac Lab·Cosmos의 역할, 회사 측 성능 수치의 조건, 산업 현장 도입 전 검증 과제
영상이 로봇의 작업 지시서가 됩니다
산업 현장에서 로봇에게 새로운 일을 맡기려면 보통 작업 순서를 프로그래밍하고, 데이터를 다시 수집해 모델을 추가로 학습해야 합니다. 공정이나 제품이 바뀔 때마다 상당한 시간과 비용이 들어가는 이유입니다.
Skild AI S1은 이 과정을 영상 한 편으로 줄이려는 로봇 파운데이션 모델입니다. 작업자가 원하는 행동을 촬영해 보여주면 S1이 영상 속 의도와 물체, 행동 순서를 해석한 뒤 실제 로봇의 동작으로 변환합니다.
중요한 점은 영상을 단순히 그대로 따라 하는 방식이 아니라는 것입니다. 촬영 장소와 카메라 시점이 달라지고 영상 속 사람과 실제 작업을 수행할 로봇의 신체 구조가 달라도, 무엇을 해야 하는지 파악하도록 설계됐습니다.
이 글에서 다룰 내용
Skild AI S1의 작동 원리, 영상 학습 로봇이 주목받는 이유, NVIDIA 기술의 역할, 산업용 로봇 시장에 미칠 변화
인컨텍스트 러닝이 특별한 이유
S1의 핵심은 인컨텍스트 러닝입니다. 언어 모델이 프롬프트에 포함된 예시를 참고해 답변 방식을 바꾸는 것처럼, S1은 시범 영상을 현재 작업을 알려주는 문맥으로 사용합니다.
기존 방식은 새로운 작업마다 모델의 가중치를 업데이트하거나 별도의 후속 학습을 진행하는 경우가 많았습니다. 반면 S1은 사전 학습된 하나의 모델을 유지하면서, 실행 시점에 제공된 영상을 바탕으로 행동을 결정합니다.
Skild AI는 화분 분갈이, 팬케이크 조리, 핸드드립 커피 만들기, 부품 키트 조립처럼 사전 학습에서 직접 다루지 않은 작업도 시연했습니다. 작업 시간이 최대 10분에 이르고 수십 단계가 이어지는 장기 작업이라는 점이 눈에 띕니다.
화분 분갈이 실험에서는 영상 시범을 촬영한 뒤 실제 로봇이 자율 실행을 시작하기까지 11분이 걸렸다고 합니다. 이는 새로운 작업마다 수십 시간의 원격 조작 데이터를 모으던 개발 절차를 크게 단축할 가능성을 보여줍니다.
영상 학습 로봇은 무엇을 이해할까요?
영상 학습 로봇이 제대로 움직이려면 화면에 나타난 위치만 복사해서는 부족합니다. 컵은 들어 올릴 수 있고, 주전자는 기울여야 하며, 흙은 식물을 넣기 전에 파내야 한다는 물체의 기능적 관계까지 이해해야 합니다.
S1은 시범 영상에서 작업의 목표와 진행 상태를 함께 추론합니다. 물체가 예상과 다른 위치에 있거나 중간에 동작이 어긋나더라도 현재 상황을 확인하고 다음 행동을 조정하는 방식입니다.
이런 능력은 미리 정한 좌표와 순서를 반복하는 전통적인 산업용 로봇과 차이가 있습니다. 생산 품목과 배치가 자주 바뀌는 공장이나 물류센터에서는 재프로그래밍 부담을 낮추는 피지컬 AI가 될 수 있습니다.
다만 한 편의 영상만 보여주면 모든 작업을 완벽하게 수행한다는 뜻은 아닙니다. Skild AI가 공개한 새로운 다단계 작업 실험에서는 단계별 성공률이 약 66%였고 비교 시스템은 9%였습니다. 모두 회사 측 테스트 수치이므로 실제 생산 현장에는 독립 검증과 더 높은 신뢰성·안전 기준이 필요합니다.
NVIDIA Isaac Lab과 Cosmos의 역할
S1의 성능은 모델 구조만으로 완성되지 않습니다. 현실에서 발생할 수 있는 충돌과 접촉, 조명 변화, 물체 차이 등을 대규모로 경험할 수 있는 학습 기반이 필요합니다.
NVIDIA Isaac Lab은 로봇이 다양한 조건에서 강화학습을 진행하도록 돕는 개방형 로봇 학습 프레임워크입니다. 힘과 접촉, 충돌, 압력 같은 물리 요소를 시뮬레이션해 가상 환경에서 배운 행동과 실제 로봇 동작 사이의 차이를 줄이는 데 활용됩니다.
NVIDIA Cosmos 오픈 월드 파운데이션 모델은 학습 데이터를 다양화하고 영상을 구조화된 설명으로 바꾸는 데 활용됩니다. NVIDIA 발표 기준으로 Cosmos Curator는 대규모 데이터의 주석·필터링·정리를 지원합니다.
여기에 NVIDIA Omniverse와 Isaac Sim을 이용하면 물리 기반 가상 환경에서 행동을 시험하고 위험한 실패 사례도 안전하게 반복할 수 있습니다. 결국 NVIDIA의 가속 컴퓨팅과 시뮬레이션 생태계가 S1의 피지컬 AI 학습 공장 역할을 하는 셈입니다.
산업용 로봇의 운영 방식이 달라질까?
산업용 로봇은 반복성과 정밀도가 뛰어나지만, 제품이나 공정이 달라지면 다시 설정해야 하는 경우가 많습니다. S1과 같은 범용 로봇 파운데이션 모델은 작업자가 영상을 촬영해 새로운 업무를 전달하는 운영 방식을 제시합니다.
현장 직원이 시범을 보여주고 로봇이 이를 짧은 시간 안에 재현할 수 있다면 다품종 소량 생산, 포장, 조립처럼 변화가 잦은 작업에 유리합니다. 로봇 전문 프로그래머가 모든 동작을 일일이 작성해야 하는 부담도 줄어들 수 있습니다.
그러나 실제 도입 여부는 평균적인 시연 성공보다 예외 상황에서의 안정성에 달려 있습니다. 작업 실패 감지, 사람과의 충돌 방지, 품질 검사, 책임 소재까지 함께 설계돼야 비로소 생산 현장에서 신뢰할 수 있는 시스템이 됩니다.
영상 한 편이 만드는 피지컬 AI의 다음 단계
Skild AI S1은 로봇 교육의 단위를 코드와 대규모 데이터 수집에서 짧은 시범 영상으로 바꾸려는 시도입니다. 아직 공개 시연과 회사 측 실험 결과를 실제 현장의 완성도로 동일하게 볼 수는 없지만, 인컨텍스트 러닝이 로봇의 작업 전환 시간을 줄일 가능성은 분명하게 보여줍니다.
NVIDIA Isaac Lab과 NVIDIA Cosmos가 제공하는 시뮬레이션·데이터 기반까지 결합되면 로봇은 더 다양한 실패를 가상 환경에서 경험하고 새로운 현장에 빠르게 적응할 수 있습니다. 앞으로의 경쟁은 정해진 동작을 얼마나 빠르게 반복하느냐보다, 처음 보는 작업을 얼마나 안전하고 정확하게 이해하느냐에서 갈릴 가능성이 큽니다.
한 줄 요약: Skild AI S1은 영상 한 편을 작업 지시서로 활용해 새로운 일을 배우는 피지컬 AI의 가능성을 보여줍니다.
