바이트댄스·프린스턴대·칭화대·UCLA·하이퍼볼릭 랩스 공동 연구진이 순환형 AI 모델의 지속학습 성능을 높인 '고속 가중치 어텐션' 프레임워크 '팰컨(Falcon)'을 공개했다. 기존 순환형 모델(맘바, 델타넷 등)이 겪던 '시간적 정렬' 오류를 해결하기 위해 기억 업데이트 순서를 '읽은 뒤 쓰는' 방식으로 재설계했다. 파인웹-에듀 500억 토큰 학습 실험에서 팰컨-1.3은 검증 퍼플렉시티 17.10을 기록해 게이티드 델타넷(17.32)과 트랜스포머(17.38)를 앞섰고, 48자리 덧셈 실험에서는 정확도 69%로 트랜스포머(49%)를 20%포인트 앞질렀다. 다만 이 기억은 임시 기억으로 대규모 상용 LLM 확장은 향후 과제로 남았다.
- •바이트댄스 등 공동연구진, 순환형 모델 지속학습 개선한 '팰컨' 프레임워크 공개
- •기억 업데이트를 '읽은 뒤 쓰는' 방식으로 재설계해 '시간적 정렬' 오류 해결
- •파인웹-에듀 실험서 팰컨-1.3 퍼플렉시티 17.10, 게이티드 델타넷·트랜스포머 능가
- •48자리 덧셈 정확도 69%로 트랜스포머(49%)보다 20%포인트 높은 장기 문맥 유지력 입증
- •임시 기억(fast weight)만 다뤄 대규모 상용 LLM 확장은 향후 과제로 남음
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
'기억 저장 순서' 바꿔 성능 향상...고속 어텐션 프레임워크 '팰컨' 등장
- 1.바이트댄스·프린스턴·칭화대 공동연구, 지속학습 문제 해결한 고속 가중치 어텐션 '팰컨' 공개
- 2.기억 업데이트를 '읽은 뒤 쓰는' 방식으로 재설계해 순환형 모델의 시간적 정렬 오류 해결
- 3.파인웹-에듀 실험서 팰컨-1.3 퍼플렉시티 17.10, 게이티드 델타넷·트랜스포머 능가
- 4.48자리 덧셈 실험서 팰컨-3A.3 정확도 69%로 트랜스포머(49%) 대비 20%p 앞서
왜 중요한가?
기존 순환형 모델의 고질적 문제였던 정보 저장 시점과 예측 시점의 불일치를 해결해 긴 문맥 처리 성능을 개선했다는 점에서, 향후 대규모 상용 LLM의 지속학습 적용 가능성을 넓히는 연구다.
본문 미리보기
대형언어모델(LLM)이 학습을 끝낸 뒤에도 새로운 정보를 처리하는 과정에서 내부 기억을 계속 갱신하도록 만드는 ‘지속학습(continual learning)’ 연구가 속도를 내고 있다. 바이트댄스와 프린스턴대학교, 칭화대학교, UCLA, 하이퍼볼릭 랩스 공동 연구진은 최근 순환형 AI 모델이 새로운 정보를 기억하고 업데이트하는 과정에서 발생하는 문제를 분석하고 이를 개선한 ‘고속 가중치 어텐션(Fast Weight Attention)’ 프레임워크 ‘팰컨(Falcon)’을 온라인 아카이브를 통해 공개했다. 대부분의 LLM은 학습이 끝
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
