LLM 기반 에이전트의 광범위한 활용을 위해 인간 사회적 가치와의 강력한 정렬이 필요하지만, 현재 모델들은 자기 인식, 딜레마 결정, 자기 감정 측면에서 부족함을 보인다. 이 연구는 GraphRAG로 원칙을 가치 기반 지침으로 변환하고 특정 대화 맥락에 맞는 지침을 검색해 에이전트를 조종하는 프레임워크를 제안한다. DAILYDILEMMAS 벤치마크에서 ECoT, Plan-and-Solve 등 프롬프트 기반 기준 방법 대비 유의미한 성능 향상을 달성하며 AI 시스템의 자기 감정 출현 가능성을 제시했다.
- •LLM 에이전트의 사회적 가치 정렬에서 자기 인식, 딩레마 결정, 자기 감정 능력이 부족
- •GraphRAG로 원칙을 가치 기반 지침으로 변환하고 맥락에 맞는 지침을 검색해 에이전트 조종
- •매슬로우 욕구 위계와 플루칙 감정 수레바퀴 이론으로 기대 행동을 정의하고 평가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents
- 1.GraphRAG로 사회적 가치 원칙을 가치 기반 명령어로 변환해 LLM 에이전트 행동을 조정하는 프레임워크
- 2.매슬로우 욕구 계층과 플루치크 감정 바퀴를 기준으로 에이전트 기대 행동을 정의 및 평가
- 3.DAILYDILEMMAS 벤치마크에서 ECoT, Plan-and-Solve 등 프롬프트 기반 기준선 대비 유의미한 성능 향상
왜 중요한가?
LLM 에이전트가 인간 사회 가치와 정렬된 결정을 내리도록 심리학적 이론을 활용한 구조적 프레임워크를 제공해 AI 정렬 연구에 기여한다.
언급 프로젝트
본문 미리보기
arXiv:2605.14034v1 Announce Type: new Abstract: Wide applications of LLM-based agents require strong alignment with human social values. However, current works still exhibit deficiencies in self-cognition and dilemma decision, as well as self-emotions. To remedy this, we propose a novel value-based framework that employs GraphRAG to convert principles into value-based instructions and steer the agent to behave as expected by retrieving the suitable instruction upon a specific conversation conte
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

