논쟁 4: 데이터는 어디서 오는가
논쟁 4: "인류를 다운로드하는" 시대, 데이터는 어디서 오는가?
Saining Xie의 진단
Saining Xie는 현재 AI 발전 단계를 아우르는 큰 그림을 제시합니다.
"예전에는 인터넷을 다운로드하는 시대였다면, 지금은 인류를 다운로드하는 시대입니다."
첫 번째 단계인 "인터넷을 다운로드하는 것"은 LLM의 학습 데이터를 가리킵니다. Common Crawl(웹 페이지를 지속적으로 수집하는 공개 데이터셋으로, 수십억 개 페이지의 원본 텍스트를 담고 있으며 GPT 계열이나 LLaMA 같은 대형 모델의 주요 학습 말뭉치입니다), Wikipedia, GitHub, 그리고 책까지, 인류가 디지털 공간에 남긴 모든 문자 흔적입니다. 이 데이터의 규모는 어마어마하지만, 언어만 있을 뿐 물리가 없다는 근본적인 한계가 있습니다.
두 번째 단계인 "인류를 다운로드하는 것"은 월드모델에 필요한 데이터를 가리킵니다. 1인칭 시점의 인간 조작 영상, 산업 센서 데이터, 로봇 텔레오퍼레이션 데이터, 의료 시술 영상 같은 것들입니다. 이 데이터가 기록하는 건 인간이 물리 세계에서 어떻게 행동하는가이지, 인간이 행동을 어떻게 묘사하는가가 아닙니다.
Saining Xie는 놀라운 규모 비교를 제시합니다. 네 살 아이가 그 4년의 삶 동안 받아들이는 시각 정보의 양은, 프레임과 픽셀로 환산하면 GPT-4를 학습시키는 데 쓰인 모든 텍스트 토큰을 합친 것보다도 많습니다.

결정적으로, 이 데이터는 YouTube에 올라오지 않습니다. 병원 수술실, 공장 조립 라인, 농업 현장, 가정집 부엌 안에 머물러 있으며, 수많은 사적 공간에 흩어져 있고, 디지털화되지도 주석이 달리지도 않은 상태입니다.
AMI Labs의 데이터 전략
Saining Xie는 자신의 팀이 취하는 접근법을 상향식 연합(grassroots coalition, 소수의 대기업이 주도하는 하향식 방식이 아니라 여러 기업이 자발적으로 모여 협력하는 방식)이라고 설명합니다. 실제 세계 데이터를 보유한 기업들, 즉 산업 제조, 의료, 농업 분야의 기업들을 찾아, 데이터를 모델 능력과 교환하게 하고, 함께 월드모델을 만들어가는 방식입니다.
그는 금융 산업에 빗대어 설명합니다. Mastercard와 Visa의 성공은 그들 자신이 많은 돈을 갖고 있어서가 아니라, 모든 은행이 기꺼이 참여하고 싶어 하는 네트워크를 구축했기 때문이라는 것입니다. 월드모델의 데이터 전략도 비슷한 네트워크 효과가 필요할 수 있습니다. 어떤 기업도 혼자서는 충분한 물리 세계 데이터를 축적할 수 없지만, 연합을 이루면 가능합니다.
더 깊은 난제
이 비전 뒤에는 Saining Xie도 외면하지 않는 몇 가지 심각한 난제가 있습니다.
주석 비용이 극도로 높습니다. 산업용 로봇 조작 영상 하나를 주석 달려면, 모든 관절의 상태, 모든 물체의 속성, 모든 동작 뒤에 숨은 의도까지 담아내야 하는데, 이는 이미지 한 장의 범주에 레이블을 붙이는 것보다 훨씬 복잡합니다.
프라이버시와 소유권 문제입니다. 의료 영상에는 환자의 프라이버시가, 공장 데이터에는 영업 비밀이, 가정 영상에는 개인 프라이버시가 걸려 있습니다. 데이터가 유통되려면 복잡한 법적·윤리적 문제를 풀어야 합니다.
윤리적 경계 문제입니다. "인류를 다운로드한다"는 표현 자체가 불안감을 자아냅니다. 인간의 행동 데이터, 의사결정 패턴, 신체 움직임 모두가 기계를 학습시키는 데 쓰이게 됩니다. 그 경계는 어디에 있을까요? 누가 그것을 정할까요?
여러분에게 남기는 질문
월드모델이 결국 모든 사람의 일상에서 나오는 센서 데이터, 즉 여러분이 쓰는 AR 안경, 집 안의 카메라, 업무 중 남게 되는 조작 기록을 필요로 한다면, 여러분은 그 프라이버시를 더 유능한 AI 어시스턴트와 맞바꾸시겠습니까?
한 걸음 더 들어가 보면, 그 선택은 정말로 여러분이 "동의"하거나 "거부"할 수 있는 것일까요? 아니면 이것도 스마트폰처럼, 참여하지 않으면 배제되는 인프라가 되어버릴까요?
더 읽을거리
- Sutton(2019): The Bitter Lesson: 탐색과 학습이 인간이 설계한 지식을 능가한다는 핵심 논지
- LeCun, Y. A Path Towards Autonomous Machine Intelligence(L01 더 읽을거리 참고)
- Ha & Schmidhuber(2018): World Models(L01 더 읽을거리 참고)
- Saining Xie 인터뷰, 《비즈니스 인터뷰》(Xiaojun Zhang, 2024). YouTube
- LeCun, Y.(2026년 5월). LLM 안전성, VLA, JEPA에 관한 인터뷰. YouTube