넷플릭스가 수천 개의 수작업 특징 대신 언어모델 기반 추천 시스템 GenRec을 시험해 기존 추천 엔진보다 나은 성능을 확인했다. GenRec은 시청 기록과 맥락을 텍스트로 변환해 파인튜닝된 오픈소스 모델이 후보작을 한 번에 스코어링하는 방식으로, 오프라인 테스트에서 순위 품질이 약 1.6% 개선됐고 2단계 학습에 필요한 라벨 데이터는 40분의 1로 줄었다. 트래픽 10%를 대상으로 한 4주간 A/B 테스트에서도 단기·장기 지표가 통계적으로 유의미하게 상승했다. 넷플릭스는 이를 완전 대체가 아닌 범용 언어모델로의 전환 초기 단계로 보고 있으며, 특징 엔지니어링에서 맥락 엔지니어링으로 무게중심이 옮겨가고 있음을 시사한다.
- •GenRec은 시청 기록을 자연어 텍스트로 바꿔 파인튜닝된 오픈소스 언어모델로 추천 후보를 한 번에 스코어링한다.
- •오프라인 테스트에서 기존 시스템 대비 순위 품질이 약 1.6% 향상됐고, 2단계 학습용 라벨 데이터는 40분의 1 수준으로 감소했다.
- •트래픽 10% 대상 4주 A/B 테스트에서 단기 지표 0.115%, 장기 지표 0.006% 상승, 두 결과 모두 통계적으로 유의미했다.
- •존재하지 않는 콘텐츠를 추천하는 환각을 막기 위해 실제 카탈로그 항목만 채점하는 별도 컴포넌트를 추가했다.
- •넷플릭스는 GenRec을 PLUM, GLIDE, OneRec-Think 등과 함께 특징 엔지니어링에서 맥락 엔지니어링으로 넘어가는 흐름의 일환으로 본다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Netflix tests language model as alternative to hand-built recommendation logic

- 1.넷플릭스, 언어모델 기반 추천시스템 'GenRec' 개발해 기존 수년간 고도화된 추천엔진 대비 오프라인 랭킹 품질 약 1.6% 개선
- 2.시청기록·시청시간·좋아요 등을 자연어 텍스트로 변환해 입력하고, 미세틜윀한 오픈웨이트 모델이 후보들을 한 번에 점수매김
- 3.2단계 학습에서 기존 대비 라벨링 데이터를 약 40배 적게 사용하고도 성능 달성
- 4.4주간 트래픽 10% 대상 A/B테스트에서 단기 지표 0.115%, 장기 핵심 지표 0.006% 상승 확인
왜 중요한가?
수천 개 수작업 피처에 의존하던 추천 시스템을 언어모델 기반 텍스트 입력으로 대체하면 신규 콘텐츠 유형 추가나 신규 영역 확장 비용이 크게 줄어들 수 있어, 넷플릭스가 추천 아키텍처 전체를 범용 LLM 중심으로 재편할 가능성을 보여준다.
본문 미리보기
Netflix pitted its years-old recommendation engine against an in-house language model called GenRec and says it got better results. Instead of relying on thousands of hand-crafted features, GenRec converts viewing behavior into plain text. Netflix itself calls it "an early but promising step." The article Netflix tests language model as alternative to hand-built recommendation logic appeared first on The Decoder.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:33AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
