피지컬 AI 시대에 필요한 데이터 작업

피지컬 AI가 발전하려면 로봇이 현실에서 보고 움직인 경험을 학습할 수 있는 데이터로 만들어야 합니다. 이 글에서는 로봇 행동 데이터의 수집부터 주석·구조화, 다국어 명령 데이터, 품질 검수까지 피지컬 AI 시대에 필요한 주요 데이터 작업을 살펴봅니다.

피지컬 AI(Physical AI)는 AI가 현실 세계를 보고 상황을 판단한 뒤 로봇이나 장비를 실제로 움직이게 하는 기술입니다. 사람의 명령을 이해하고 물건을 집는 휴머노이드부터 공장 안에서 스스로 이동하고 작업하는 로봇까지 적용 범위가 빠르게 넓어지고 있습니다.

한국은 이러한 변화에 유리한 산업 기반을 갖추고 있습니다. 국제로봇연맹(IFR)의 최신 공개 자료에 따르면 한국의 제조업 로봇 밀도는 근로자 1만 명당 1,220대로 세계에서 가장 높습니다. 전자와 자동차 산업을 중심으로 이미 많은 산업용 로봇이 현장에서 가동되고 있다는 의미입니다.

정부도 2026년 발표한 ‘피지컬 AI 핵심 경쟁력 확보 전략’에서 데이터, 기술, 확산, 생태계를 4대 추진 전략으로 제시하고, 다양한 산업 현장의 실제 데이터와 합성 데이터를 확보해 기술 개발에 활용하는 체계를 주요 과제로 두었습니다.

로봇 하드웨어와 AI 모델이 발전할수록 함께 커지는 것이 데이터 수요입니다. 그렇다면 피지컬 AI를 학습시키기 위해 어떤 데이터를 모아야 하고, 수집한 데이터에는 어떤 작업이 필요할까요?

피지컬 AI는 현실에서 일어나는 행동을 데이터로 배웁니다

LLM은 주로 많은 양의 텍스트를 학습하면서 언어와 지식을 익혔습니다. 피지컬 AI는 조금 다릅니다. 현실 세계에서 물체가 어디에 있는지 보고, 사람의 말을 이해하고, 어떤 동작을 해야 하는지 판단한 뒤 실제 움직임으로 연결해야 합니다.

예를 들어 로봇에게 “테이블 위의 물병을 선반에 올려놓아 주세요”라고 명령한다고 생각해 보겠습니다.

로봇은 물병과 선반의 위치를 찾아야 합니다. 물병까지 팔을 뻗어 적절한 힘으로 잡고, 들어 올려 선반까지 이동한 다음 안전하게 내려놓아야 합니다. 중간에 사람이 지나가거나 물병이 미끄러진다면 상황에 맞게 행동을 바꾸어야 합니다.

이 한 번의 작업에서도 여러 종류의 데이터가 동시에 만들어집니다.

  • 로봇이 보고 있는 카메라 영상
  • 사람이 내린 명령
  • 물체와 주변 환경의 위치
  • 로봇 관절의 위치와 움직임
  • 물체를 잡거나 놓는 행동
  • 이동 경로
  • 작업의 성공 또는 실패 결과
  • 각 행동이 일어난 시간

이처럼 실제 로봇이 작업하는 동안 만들어지는 데이터를 일반적으로 로봇 행동 데이터(Robot Action Data)라고 부릅니다.

피지컬 AI가 다양한 상황에서 제대로 행동하려면 같은 작업도 여러 조건에서 경험해야 합니다. 물병의 종류와 위치가 달라질 수도 있고, 주변에 다른 물건이 놓여 있을 수도 있습니다. 조명이나 작업 공간, 사람의 위치도 달라집니다.

따라서 중요한 것은 같은 동작을 많이 반복하는 것만이 아니라 다양한 상황에서 충분한 행동 데이터를 확보하는 것입니다.

데이터를 수집했다고 바로 학습할 수 있는 것은 아닙니다

로봇의 카메라와 센서에서 많은 데이터를 확보했다고 해서 바로 좋은 AI 학습 데이터가 되는 것은 아닙니다.

예를 들어 로봇이 물병을 선반으로 옮기는 15초짜리 영상이 있다고 해보겠습니다. 사람에게는 하나의 자연스러운 행동으로 보이지만, AI가 학습하려면 그 안에서 어떤 일이 일어났는지를 좀 더 정확하게 구분할 필요가 있습니다.

물병에 접근 → 손을 뻗음 → 물병을 잡음 → 들어 올림 → 선반으로 이동 → 내려놓음 → 손을 놓음

여기에 어떤 물체를 잡았는지, 각각의 행동이 어느 시점에 시작하고 끝났는지, 작업은 성공했는지, 실패했다면 어느 단계에서 문제가 발생했는지 같은 정보도 연결할 수 있습니다.

이때 필요한 것이 데이터 구조 설계와 주석(Annotation)입니다.

먼저 어떤 행동을 하나의 작업으로 볼 것인지, 행동을 어느 정도까지 나눌 것인지, 같은 행동을 어떤 이름으로 부를 것인지, 성공과 실패를 어떤 기준으로 판단할 것인지를 정해야 합니다. 그 다음 그 기준을 실제 데이터에 일관되게 적용합니다.

피지컬 AI에서는 예를 들어 다음과 같은 구조를 만들 수 있습니다.

Task → Action → Object → Result

또는 조금 더 세분화하면,

전체 작업 → 세부 작업 → 개별 행동 → 대상 물체 → 성공·실패

와 같은 방식입니다.

이러한 기준이 없으면 같은 행동을 작업자마다 다르게 판단할 수 있고, 결국 많은 데이터를 모아도 학습 품질이 떨어질 수 있습니다.

기존 AI 데이터에서도 핵심은 ‘공통 기준’을 만드는 일이었습니다

이 문제는 피지컬 AI에서 처음 등장한 것은 아닙니다.

한샘글로벌이 수행한 다국어 AI 학습 데이터 프로젝트에서는 서로 구조가 다른 방대한 문서를 바로 주석하기 시작하지 않았습니다. 먼저 4개 언어의 대표 문서를 분석해 어떤 정보를 어떤 기준으로 표시할 것인지 공통 규칙을 만들고, 데이터 유형과 처리 방법을 정의한 뒤 본격적인 작업에 들어갔습니다. 20개가 넘는 품질 점검 항목도 작업 과정에 함께 적용했습니다.

그 결과 수만 페이지의 4개 언어·2개 지역 데이터를 하나의 기준으로 처리할 수 있었습니다. 다국어 AI 학습 데이터 주석 (Annotation) 프로젝트 케이스스터디 를 참고해 주세요.

문서 데이터에서는 이름, 날짜, 주소와 같은 정보를 구분했다면 피지컬 AI에서는 작업(Task), 행동(Action), 물체(Object), 결과(Result) 등이 주석의 대상이 될 수 있습니다.

데이터의 종류는 달라지지만 원리는 비슷합니다.

무엇을 구분할 것인지 정의하고 → 공통 규칙을 만들고 → 많은 작업자가 같은 기준으로 데이터를 처리하고 → 결과를 검수하는 과정이 필요합니다.

이러한 경험은 앞으로 피지컬 AI 데이터 주석, 로봇 행동 데이터 주석, 행동 데이터 분류체계 설계, 피지컬 AI 데이터 품질 검수와 같은 영역으로 확장될 수 있습니다.

로봇에게도 사람의 언어 데이터가 필요합니다

피지컬 AI 데이터라고 하면 영상이나 센서 데이터부터 떠올리기 쉽습니다. 하지만 사람과 함께 일하는 로봇이라면 언어 역시 중요한 학습 대상입니다.

사람은 같은 일을 여러 방식으로 말합니다.

“컵을 식탁 위에 올려 주세요.”

“저 컵 테이블로 좀 옮겨 주세요.”

“컵 좀 저쪽에 갖다 놔줘.”

사람에게는 비슷한 의미지만 문장의 구조와 단어는 모두 다릅니다. 로봇이 정해진 한두 문장만 알아듣는 것이 아니라 실제 사용자의 다양한 표현을 이해하려면 이런 언어 데이터도 충분히 학습해야 합니다.

최근에는 영상과 언어를 함께 이해하고 행동으로 연결하는 VLA(Vision-Language-Action) 모델이 피지컬 AI의 중요한 기술로 주목받고 있습니다.

이름은 어렵지만 개념은 비교적 간단합니다.

보고(Vision) → 사람의 말을 이해하고(Language) → 행동(Action)하는 AI입니다.

글로벌 시장에서는 문제가 더 복잡해집니다. 영어로 학습한 로봇이 한국어, 일본어, 독일어 사용자의 명령도 정확하게 이해해야 합니다. 단순히 영어 명령을 다른 언어로 번역하는 것만으로 충분하지 않을 수도 있습니다.

예를 들어 같은 한국어 사용자라도 상황에 따라

“문을 닫아 주세요.”

“문 좀 닫아줘.”

“저 문 닫아줄래?”

처럼 서로 다른 표현을 사용할 수 있습니다.

따라서 앞으로는 다국어 로봇 명령 데이터 작성, 같은 명령의 다양한 표현 생성, 언어별 데이터 검수, 다국어 VLA 평가 데이터 구축과 같은 작업의 필요성도 커질 수 있습니다.

사람에게 데이터를 만들게 하고 AI로 다시 검증하는 과정

한샘글로벌이 수행한 또 다른 AI 데이터 프로젝트에서도 이러한 가능성을 확인할 수 있습니다. 읽어보기: AI가 못 푸는 문제: 각국 원어민의 문화 기반 프롬프트 케이스스터디

이 프로젝트에서는 15개국 이상의 원어민 작성자를 모집해 각 나라의 언어와 문화에 기반한 새로운 AI 평가용 프롬프트를 만들었습니다. 작성자는 일정한 기준에 따라 데이터를 만들고, 직접 대상 AI에 입력해 실제로 모델이 답을 제대로 내놓는지 확인했습니다. 그 뒤 별도의 검수팀이 결과를 다시 독립적으로 검증했습니다.

AI가 답하지 못했는지, 틀린 답을 내놓았는지, 겉으로는 맞아 보이지만 사실이나 논리에 오류가 있는지도 구분해 기록했습니다. 이렇게 만들어진 결과는 단순한 질문 모음이 아니라 모델의 성능을 평가하는 데이터로 다시 활용할 수 있었습니다.

이와 같은 사람에 의한 데이터 생성 → 모델 테스트 → 독립 검수 방식은 향후 피지컬 AI에도 적용할 수 있습니다.

예를 들어 여러 나라의 사람들이 실제로 사용하는 표현으로 로봇 명령 데이터를 만들고, 이를 로봇이나 VLA 모델에 입력한 뒤 제대로 이해하고 행동하는지 평가하는 것입니다.

같은 행동이라도 언어와 표현을 바꾸어 테스트한다면 다국어 피지컬 AI 평가 데이터로 활용할 수도 있습니다.

피지컬 AI 데이터가 커질수록 사람의 역할도 커집니다

AI가 발전하면 데이터 작업도 모두 자동화될 것이라고 생각하기 쉽습니다. 실제로 자동화할 수 있는 부분은 계속 늘어날 것입니다.

그러나 새로운 데이터를 만들고, 행동의 의미를 판단하고, 애매한 사례를 구분하고, 결과가 정확한지를 확인하는 과정에는 여전히 사람의 판단이 필요합니다.

피지컬 AI 데이터 프로젝트에서는 역할도 다양해질 수 있습니다.

로봇을 직접 조작해 행동 데이터를 만드는 작업자가 있을 수 있고, 영상을 보면서 행동 구간을 구분하는 작업자도 필요합니다. 사람의 명령을 작성하는 언어 작업자, 결과를 검수하는 QA 인력, 특정 제조 공정을 이해하는 분야 전문가가 함께 참여할 수도 있습니다.

데이터 규모가 커지면 여기서 또 다른 문제가 생깁니다.

필요한 조건을 갖춘 사람을 어떻게 찾고, 실제 투입이 가능한지 확인하고, 적절한 작업에 배정하며, 많은 작업자의 상태를 어떻게 관리할 것인가 하는 운영 문제입니다.

AI 데이터 프로젝트에서는 데이터를 만드는 기술만큼 데이터를 만드는 사람을 운영하는 체계도 중요해집니다.

대규모 AI 데이터 작업을 위해 만든 Hansem RMS

한샘글로벌이 자체적으로 Hansem RMS(Resource Management System)를 개발한 이유도 이러한 대규모 인력 운영 문제 때문입니다.

AI 데이터 프로젝트는 일반적인 번역 프로젝트보다 짧은 기간에 많은 작업자가 동시에 필요한 경우가 있습니다. 특정 언어와 국가, 경험, 전문 분야와 같은 조건에 맞는 인력을 빠르게 찾아야 하고, 후보자가 실제로 프로젝트에 참여할 수 있는지도 확인해야 합니다.

Hansem RMS는 이러한 프로젝트 운영을 위해 리소스 등록과 검색, 후보 선별, 가용성 확인, 프로젝트 요청, 최종 배정, 커뮤니케이션 이력까지 하나의 흐름으로 관리하도록 만든 내부 운영 시스템입니다. AI 데이터 프로젝트의 핵심, 대규모 리소스 운영 시스템 블로그 기사를 참고해 주세요.

이 시스템은 피지컬 AI를 위해 개발된 것은 아닙니다. 많은 사람이 동시에 참여하는 AI 데이터 프로젝트를 실제로 수행하면서 반복적으로 발생하는 운영상의 병목을 줄이기 위해 구축했습니다.

하지만 피지컬 AI 데이터 프로젝트가 대규모화되면 비슷한 운영 문제가 발생할 가능성이 높습니다.

로봇 행동 데이터 주석자, 언어별 데이터 작성자, 검수자, 특정 산업의 작업 과정을 이해하는 전문가처럼 서로 다른 조건을 가진 많은 사람이 참여한다면 단순히 인력 풀을 많이 확보하는 것으로는 충분하지 않습니다.

필요한 사람을 찾고 → 참여 가능 여부를 확인하고 → 적절한 작업에 배정하고 → 진행 상태와 이력을 관리하는 운영 체계가 필요합니다.

피지컬 AI 데이터 구축에서도 결국 데이터 기술과 함께 대규모 사람을 안정적으로 운영할 수 있는 인프라가 중요한 역할을 할 수 있습니다.

피지컬 AI 데이터 산업의 범위는 생각보다 넓습니다

피지컬 AI 데이터를 로봇에 센서를 달아 영상을 수집하는 일만으로 보면 전체 데이터 작업의 일부만 보게 됩니다.

실제 로봇을 움직여 영상과 센서 데이터를 수집하는 과정이 먼저 필요합니다. 그러나 그 다음에는 수집한 데이터를 학습 가능한 구조로 만들고, 행동에 의미를 붙이고, 사람의 언어와 연결하고, 성공과 실패를 구분하고, 결과가 정확한지 검수하는 과정이 이어집니다.

글로벌 시장에서 사용하는 로봇이라면 각 나라 사용자의 언어와 표현을 반영한 데이터를 만들고, 언어가 달라져도 같은 작업을 제대로 수행하는지 평가하는 과정도 필요해질 것입니다.

결국 피지컬 AI 데이터는 다음과 같은 긴 흐름으로 볼 수 있습니다.

로봇 행동 데이터 수집
→ 데이터 구조 설계
→ 행동 데이터 주석
→ 품질 검수
→ 로봇 명령 데이터 생성
→ 다국어 모델 평가
→ 평가 결과를 다시 학습 데이터에 반영

한샘글로벌이 지금까지 수행해 온 다국어 AI 학습 데이터 주석, 원어민에 의한 AI 평가 데이터 생성, 대규모 리소스 운영은 이 흐름의 일부와 이미 맞닿아 있습니다.

아직 피지컬 AI 시장은 초기 단계이고 어떤 데이터 서비스가 표준으로 자리 잡을지는 더 지켜봐야 합니다. 다만 AI가 텍스트와 이미지의 세계에서 현실의 물리적 공간으로 나오면서 AI가 학습해야 할 데이터의 대상도 문서와 문장에서 물체와 행동, 사람의 명령으로 넓어지고 있습니다.

피지컬 AI 경쟁이 본격화될수록 데이터를 얼마나 많이 수집하는가뿐 아니라, 수집한 데이터를 어떻게 구조화하고 주석하고 검수하며 대규모로 운영할 것인가도 중요한 경쟁 요소가 될 것입니다.