스탠퍼드대 마이클 프랭크 등 인지과학자들은 LLM이 인간 아이보다 수십만 배 많은 데이터를 학습하고도 언어 습득에서는 뒤처진다는 '데이터 효율성 격차'를 연구하고 있다. 아이는 1,000만~3,000만 단어만 듣고도 문법적으로 올바른 문장을 구사하는 반면, 메타 Llama 3.1은 사전학습에 15조 토큰을 사용했다. 이 격차를 좁히기 위해 워스타트 등이 만든 BabyLM 대회는 1억 단어(유아 트랙은 1,000만 단어)로 모델을 학습시키며, 2024년 우승작 GPT-BERT는 1억 단어만으로 15,000배 많은 데이터로 학습한 메타 Llama 2 70B의 특정 벤치마크 성능을 넘어섰다. 프랭크의 SAYCam, 하슨의 '첫 1,000일' 프로젝트 등 아기 헤드캠 영상을 활용한 시도도 있지만 텍스트만큼 성공적이지 못했으며, 고프닉 등은 아이의 능동적 탐색과 사회적 학습이 핵심 요인일 수 있다고 본다. 데이터 격차 해소는 소수언어 AI 개발과 인간 인지 이해에도 중요한 함의를 갖는다.
- •아이는 1,000만~3,000만 단어만으로 문법적 문장 구사, LLM은 수조~수십조 토큰 필요('데이터 효율성 격차')
- •BabyLM 대회: 1억 단어(유아 트랙 1,000만 단어)로 학습, 2024 우승작 GPT-BERT가 15,000배 많은 데이터의 Llama 2 70B 능가
- •프랭크의 SAYCam, 하슨의 '첫 1,000일' 프로젝트 등 아기 헤드카 영상으로 멀티모달 학습 시도, 텍스트만큼 성공적이지 않음
- •고프닉·보나위츠: 아이의 능동적 탐색과 사회적 학습(교사 의도 추론)이 데이터 효율의 핵심일 가능성
- •데이터 격차 해소는 소수언어 AI 개발과 인간 언어습득 이해에 모두 기여할 잠재력
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Kids outlearn AI—and we still don’t know why
- 1.LLM은 아이보다 수십만 배 많은 데이터를 학습해야 언어를 습득, '데이터 효율성 격차'로 불림
- 2.아이는 1억~3억 단어 노출로 문법을 익히나 Llama 3.1은 사전학습에 15조 토큰 사용
- 3.BabyLM 대회 2024 우승작 GPT-BERT, 1억 단어만으로 15,000배 큰 Llama 2 70B 벤치마크 능가
- 4.아기 헤드캠 데이터(SAYCam)로 시각+언어 학습 재현 시도는 아직 한계, Meta·Q Labs도 연구 중
왜 중요한가?
인터넷 학습 데이터가 2030년대 초 고갈될 수 있다는 전망 속에서, 아이의 학습 방식을 모방한 데이터 효율적 AI는 저자원 언어·소규모 연구기관에도 실마리가 된다.
본문 미리보기
People have been talking to each other for at least 100,000 years, as best we can tell. And in all that time, there has been only one thing in the world that could learn a human language to perfect fluency: a human child. Now there are two. Four short years after the release of ChatGPT,…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
