NaviGen은 사용자의 상호작용 기록을 실행 가능한 생성 지시문으로 변환하는 개인화 콘텐츠 생성 프레임워크다. 기존 AIGC 파이프라인은 잘 작성된 지시문을 전제하지만 사용자는 시각적 세부를 명확히 표현하지 못해 생성기가 수요와 어긋난다. NaviGen은 두 가지 난점, 즉 행동을 언어 추론이 읽을 수 있는 형태로 인코딩하는 문제와 사전학습·행동 데이터에 없는 지시문 작성 능력 습득 문제를 해결한다. 각 아이템을 협업 코드와 텍스트 코드를 결합한 이중 식별자로 표현해 행동 기반과 의미 다리를 하나의 토큰 스트림에 담고, SFT+RL 2단계 파이프라인으로 진화 탐색된 지도신호에서 선호 추론과 지시문 작성을 증류한 뒤 계층적·자기일관 보상으로 생성을 사용자 의도에 정렬한다. 제품·게임·숏폼 도메인 실험에서 개인화 이미지·영상 생성과 다음 아이템 예측을 개선하고 더 구체적이고 생성 가능한 지시문을 산출했다.
- •사용자 상호작용 기록을 실행 가능한 생성 지시문으로 변환하는 개인화 생성 프레임워크
- •협업 코드+텍스트 코드 이중 식별자로 행동 기반과 의미를 한 토큰 스트림에 통합
- •SFT+RL 2단계로 선호 추론·지시문 작성 증류 후 계층·자기일관 보상으로 의도 정렬
- •제품·게임·숏폼 도메인에서 개인화 이미지·영상 생성 개선
- •다음 아이템 예측 강화 및 더 구체적·생성 가능한 지시문 산출
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Navigating User Behavior toward Personalized Multimodal Generation
- 1.NaviGen이 사용자 상호작용 이력을 실행 가능한 생성 지시문으로 변환, 개인화 이미지·영상 생성 개선
- 2.협업 코드와 텍스트 코드를 결합한 이중 식별자로 행동을 언어 추론 가능한 형태로 인코딩
- 3.SFT+RL 2단계로 선호 추론·지시문 작성 학습, 계층적·자기일관 보상으로 의도 정렬
- 4.상품·게임·숏비디오 도메인에서 다음 항목 예측 강화 및 더 구체적인 지시문 생성
왜 중요한가?
AIGC 파이프라인은 잘 작성된 생성 지시문을 전제하지만 사용자는 시각적 세부를 거의 표현하지 못하는 정렬 문제를, 행동 이력을 언어 추론 가능한 토큰으로 인코딩해 지시문을 자동 작성하는 방식으로 해결한다.
언급 프로젝트
사용자 행동 기반의 맞춤형 멀티모달 생성 기술은 정교한 지시 없이도 사용자의 실제 요구에 부합하는 AI 생성 콘텐츠를 제공하는 데 중요합니다. 이는 까다로운 국내 소비자들의 니즈를 충족시키고 AI 기반 콘텐츠 제작 시장의 성장을 가속화하는 핵심 요소가 될 것입니다. 엔터테인먼트, 광고 등 다양한 분야에서 사용자 경험을 혁신할 잠재력이 큽니다.
본문 미리보기
arXiv:2606.24196v1 Announce Type: new Abstract: Modern AIGC pipelines deliver high-fidelity images and videos but presuppose a well-formed creation instruction, while end users rarely articulate visual details, leaving generators misaligned with user demand. We study personalized content generation, which turns a user's interaction history into an executable instruction for downstream synthesis, and identify two obstacles: behavior must be encoded in a form legible to language reasoning, and th
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:55AI 초안

