마이크로소프트 리서치 파트너 연구매니저 제니퍼 네빌이 AI 평가 연구와 'AI가 놓치는 것들'을 주제로 팟캐스트에서 인터뷰했다. 그녀가 이끄는 'AI 상호작용 및 학습' 팀은 단순 벤치마크 대신 다중 턴 대화, 협업 환경, 장기 과업 등 실제 사용 맥락에서 AI 성능을 평가하는 방법을 연구하며, 단일 턴에서 높은 성능을 보이던 모델이 요청이 여러 턴에 걸쳐 명확해질 때 성능이 크게 저하된다는 사실을 발견했다. 또 장기 문서 편집 작업에서 에이전트가 누적된 오류로 혼란에 빠지는 '의외의 실패'가 자주 나타난다고 설명했다. 그녀는 사용자들에게 AI 답변을 100% 신뢰하지 말고 검증하며, 모델이 틀렸을 때는 구체적으로 무엇이 잘못됐는지 피드백을 주는 것이 모델 개선에 도움이 된다고 조언했다.
- •네빌의 연구팀은 벤치마크 대신 다중 턴·협업·장기 과업 등 실제 환경에서 AI를 평가
- •요청이 여러 턴에 걸쳐 명확해질 때 모델 성능이 단일 턴 대비 크게 저하되는 현상 발견
- •장기 문서 편집 등에서 누적된 오류로 에이전트가 혼란에 빠지는 '의외의 실패' 다수 확인
- •사용자에게 AI 답변을 100% 신뢰하지 말고 구체적 피드백으로 모델 개선에 기여할 것을 조언
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
What AI gets wrong and what failure teaches us
- 1.MS리서치 제니퍼 네빌 연구원, LLM이 다중턴 대화에서 성능이 크게 저하되는 현상을 실증 연구로 공개
- 2.단일턴 벤치마크 대비 사용자가 여러 턴에 걸쳐 조건을 추가하는 실제 상황에서 정확도 급락 확인
- 3.장기 수행 작업에서 에이전트가 문서 내용을 훼손하는 등 '서프라이징 실패'가 누적되는 문제 제기
- 4.해법으로 대화가 꼬이면 전체 초기화 후 한 번에 완전한 지시를 다시 주는 방식을 제안
왜 중요한가?
벤치마크 성능과 실제 다중턴·장기 업무 환경에서의 신뢰성 사이에 큰 간극이 있음을 보여주며, 에이전트를 실무에 위임할 때 검증·오버사이트가 왜 필수적인지에 대한 실증적 근거를 제공한다.
언급 프로젝트
본문 미리보기
Jennifer Neville did not want to go into computer science—but that’s exactly where she landed. Neville discusses the starts and stops that led to her professional sweet spot and her work identifying “surprising failures” making it hard for AI to handle complexity. The post What AI gets wrong and what failure teaches us appeared first on Microsoft Research.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:02AI 초안

