InferenceBench는 AI 에이전트가 OpenAI 호환 추론 서버를 직접 배포하고 LLM 추론 속도를 최적화하는 개방형 벤치마크다. 에이전트는 대상 LLM, H100 GPU 1장, 최적화 시나리오(프리필 지연·디코드 지연·동시 처리량·복합)와 2시간 제한을 받는다. 15개 프론티어 에이전트 구성을 평가한 결과, 순정 PyTorch 베이스라인 대비 최대 8.08배 개선하고 vLLM 기본 설정(4.05배)을 종종 넘었지만, 같은 시간 예산의 단순 하이퍼파라미터 탐색(최대 11.53배)에는 못 미쳤다. 궤적 분석 결과 에이전트들은 관련 기법을 많이 나열하고도 단일 프레임워크로 수렴해 소수 구성만 시험했는데, 병목은 도메인 지식이 아니라 다양한 구성을 제안하고 체계적으로 평가하는 능력임을 시사한다. 암기된 해법이 통하지 않는 개방형 AI 엔지니어링 평가라는 점이 의의다.
- •H100 1장·2시간 예산으로 추론 서버 배포·최적화를 수행하는 개방형 벤치마크 InferenceBench
- •프리필 지연·디코드 지연·동시 처리량·복합 4가지 시나리오로 병목별 분리 평가
- •에이전트는 PyTorch 대비 최대 8.08배, vLLM 기본값(4.05배) 상회—하지만 단순 하이퍼파라미터 탐색(11.53배)에 열세
- •괤적 분석: 단일 프레임워크 수렴·소수 구성만 시험—병목은 지식이 아니라 다양한 전략 탐색 능력
InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents
본문 미리보기
arXiv:2607.20468v1 Announce Type: new Abstract: AI agents are increasingly used to automate research and development tasks, yet existing benchmarks typically evaluate them on prescribed workflows or narrow action spaces. Even nominally open-ended tasks can often be solved by retrieving a well-known recipe and tuning a few hyperparameters, making it unclear whether strong results reflect genuine optimization or memorized solutions. We introduce InferenceBench, where an agent must deploy an OpenA
전체 내용이 궁금하다면?
원문을 직접 읽어보세요