스탠퍼드·MIT 등 연구진이 만든 'AI 옵저버토리'는 앤트로픽·OpenAI 등 AI 기업이 선별 공개하는 이용 현황 보고서의 한계를 보완하기 위해 이용자 동의를 받은 7개 기존 데이터셋에서 2023~2025년 대화 2만4521건을 수집·분석했다. 앤트로픽의 방법론을 그대로 적용하자 전체 대화의 48%가 '업무 무관'으로 걸러졌는데, 이 대화들은 건강·인간관계, 성인·불법 주제, 괴롭힘·혐오 등에서 기업 발표보다 훨씬 민감한 이용 비중이 높았다. 모델별로도 차이가 커, 그록은 뉴스·정치 정보 검색과 허위정보 확산이, 앤트로픽은 코딩이, 제미나이는 소셜·롤플레이가, ChatGPT는 숙제 지원이 두드러졌다. 연구진은 기업 자체 보고서만으로는 AI의 이점과 위험에 대한 정책 결정을 내리기에 데이터가 지나치게 제한적이라고 지적한다.
- •AI 옥저버토리는 5000명 이용자, 52개 모델의 대화 2만4521건(발화 8만5633건)을 분석
- •앤트로픽 방법론 적용 시 전체 대화의 48%가 '업무 무관'으로 필터링됨
- •필터링된 대화는 성인·불법 주제(7.9%)와 괴롭힘·협오(27.5%) 비중이 기업 보고서보다 훨씬 높음
- •그록은 뉴스·정치 정보검색과 허위정보에서, 앤트로픽은 코딩에서, 제미나이는 소셜·롤플레이에서 두드러짐
- •기업들은 100만~150만 건의 대화를 자체 보유하지만 외부 연구자에게는 데이터를 공유하지 않음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
We still don’t know how people are really using AI
- 1.스탠퍼드·MIT 연구진, 'AI Observatory' 출범…동의 기반 7개 데이터셋 대화 8만5633건 분석
- 2.Anthropic식 업무 중심 필터링 적용 시 전체 대화의 48%가 제외되어 비업무적 사용 과소평가 확인
- 3.Grok은 뉴스·오정보에, Claude는 코딩에, Gemini는 소셜에, ChatGPT는 과제에 주로 사용되는 모델별 차이 발견
왜 중요한가?
AI 기업들이 자체 공개하는 사용 데이터는 업무 중심으로 필터링돼 실제 위험 행동을 과소대표할 수 있는데, 독립적인 대규모 대화 데이터셋을 통한 검증은 정책 결정의 근거가 될 수 있는 대안적 투명성 확보 시도라는 점에서 의미가 크다.
본문 미리보기
AI companies like Anthropic and OpenAI regularly publish reports on how people are using products like Claude and ChatGPT, but they only release the data they want us to see, AI researchers say. “There is no independent source to corroborate it,” says Anka Reuel, a computer science PhD candidate at the Stanford Trustworthy AI Research…
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:59AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
