Solvita는 가중치 업데이트 없이 LLM이 어려운 경쟁 프로그래밍 문제에서 지속적으로 학습할 수 있도록 하는 에이전틱 진화 프레임워크다. Planner, Solver, Oracle, Hacker 네 전문 에이전트가 각각 훈련 가능한 그래프 구조 지식 네트워크와 연결되어, 과거 결과 신호를 강화학습으로 네트워크 가중치에 반영해 전이 가능한 추론 경험을 축적한다. CodeContests, APPS, AetherCode, Codeforces 실전 대회에서 평가한 결과 기존 다중 에이전트 파이프라인을 능가하고 단일 패스 베이스라인 대비 정확도를 거의 두 배로 향상시켰다.
- •네 전문 에이전트(Planner·Solver·Oracle·Hacker)가 전략 선택·코드 합성·검증·적대적 해킹의 폐졼 루프를 구성한다.
- •결과 신호를 RL 업데이트로 지식 네트워크 가중치에 반영해 전이 가능한 추론 경험을 누적한다.
- •모델 가중치 업데이트 없이 코드 에이전트 중 새로운 성능 잔전수를 달성했다.
- •CodeContests, APPS, AetherCode, Codeforces에서 기존 다중 에이전트 파이프라인을 능가하며 단일 패스 비교 대비 정확도 거의 2배를 달성했다.
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- 1.Solvita는 LLM 가중치 업데이트 없이 경쟁 프로그래밍 문제를 지속적으로 학습하는 에이전틱 진화 프레임워크
- 2.Planner·Solver·Oracle·Hacker 4개 전문 에이전트가 폐쇄 루프 시스템으로 협력
- 3.각 에이전트는 그래프 구조 지식 네트워크와 결합해 과거 성공·실패에서 경험 축적
- 4.CodeContests·APPS·Codeforces 등에서 단일 패스 기준 대비 정확도 거의 2배 달성
왜 중요한가?
LLM 재훈련 없이 다중 에이전트 협력과 강화학습으로 경쟁 코딩 문제 해결 능력을 지속적으로 향상시킬 수 있음을 보여주는 중요한 연구다.
언급 프로젝트
본문 미리보기
arXiv:2605.15301v1 Announce Type: new Abstract: Large language models (LLMs) still struggle with the rigorous reasoning demands of hard competitive programming. While recent multi-agent frameworks attempt to bridge this reliability gap, they remain fundamentally stateless: they rely on static retrieval and discard the valuable problem-solving and debugging experience gained from previous tasks. To address this, we present Solvita, an agentic evolution framework that enables continuous learning
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 13:10AI 초안

