LLM 사용자가 대개 단일 출력만 보고 평가해 모드, 드문 엣지 케이스, 프롬프트 민감도 같은 분포 구조를 놓치고 일화에 의존한다고 지적한다. 연구자 13명과의 형성 연구를 토대로, 다수의 LM 생성 결과를 텍스트 그래프 위 중첩 경로로 표시하는 인터랙티브 시각화 도구 GROVE를 제안한다. GROVE는 공유 구조와 분기점, 클러스터를 드러내면서도 원시 출력 접근을 보존한다. 47·44·40명의 크라우드소싱 사용자 연구 결과, 그래프 요약은 다양성 평가 같은 구조적 판단을, 직접 출력 검사는 세부 질문에서 더 강함을 보여 하이브리드 워크플로우를 지지한다.
- •단일 출력 중심 상호작용이 LLM의 분포 구조를 가리는 문제 제기
- •다수 생성 결과를 중첩 텍스트 그래프로 시각화하는 GROVE 제안
- •공유 구조·분기·클러스터를 드러내면서 원시 출력 접근 유지
- •131명 교차 사용자 실험으로 그래프·직접 검사의 상보적 워크플로우 입증
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Beyond One Output: Visualizing and Comparing Distributions of Language Model Generations
- 1.다중 LM 생성을 격치는 텍스트 그래프 경로로 시각화하는 GROVE
- 2.모드·엣지케이스·프롬프트 민감도를 드러내 일화 일반화 오류 감소
- 3.3건 크라우드 사용자 연구(n=47/44/40)로 분포 과제 효과 검증
- 4.구조적 판단은 그래프 요약이, 디테일은 원본 출력이 강함
왜 중요한가?
LLM의 확률적 출력 다양성을 사용자가 탐색하도록 돕는 시각화로 연구자 프롬프트 설계 워크플로우의 실질적 개선을 제시
언급 프로젝트
본문 미리보기
arXiv:2604.18724v1 Announce Type: new Abstract: Users typically interact with and evaluate language models via single outputs, but each output is just one sample from a broad distribution of possible completions. This interaction hides distributional structure such as modes, uncommon edge cases, and sensitivity to small prompt changes, leading users to over-generalize from anecdotes when iterating on prompts for open-ended tasks. Informed by a formative study with researchers who use LMs (n=13)
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

