PerfReasoning은 LLM을 하드웨어 성능 추론자이자 분석적 성능 모델 코드 생성기로서 평가하는 벤치마크다. 워크로드, 아키텍처, 매핑 명세가 주어졌을 때 모델이 매핑을 비교하고 오프칩 트래픽·버퍼 요구량을 예측하도록 한다. 추론 기반 질의응답에서는 최상위 폐쇄형 모델이 90%를 넘고 최고의 오픈웨이트 모델도 82.4%에 도달했지만, 실제 성능 모델 코드를 구성하는 과제는 훨씬 어려워서 GPT-5.6 Sol만 80% 이상의 통과율을 기록했고 나머지 모델들은 평균 15% 미만에 그치며 실행 간 편차도 컸다. 과제 특화 강화학습은 40억 파라미터 모델의 매핑 추론 정확도를 15.7포인트 끌어올린 반면, 피드백 없는 다회차 자기수정 프롬프팅은 신뢰할 만한 효과를 보이지 못했다. 이는 그럴듯한 아키텍처 추론과 신뢰할 수 있는 성능 모델 구축 사이에 큰 격차가 있음을 드러낸다.
- •LLM을 성능 추론자이자 분석적 성능 모델 코드 생성기로 평가하는 벤치마크 PerfReasoning 제안
- •추론 기반 Q&A는 최상위 폐쇄형 모델 90% 초과, 최고 오픈웨이트 모델 82.4%
- •실제 모델 코드 구성 과제는 GPT-5.6 Sol만 80% 이상 통과, 나머지는 평균 15% 미만
- •과제 특화 RL이 4B 모델 정확도를 15.7포인트 향상, 피드백 없는 자기수정 프롬프팅은 효과 불안정
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
PerfReasoning: How Well Do LLMs Reason on Hardware Performance?
- 1.LLM의 하드웨어 성능 모델링 추론 능력을 평가하는 벤치마크 PerfReasoning 공개
- 2.최상위 비공개 모델은 추론형 Q&A에서 90% 이상, 최고 오픈웨이트 모델은 82.4% 달성
- 3.성능모델 코드 생성 과제는 훨씬 어려워 GPT-5.6 Sol만 80% 돌파하고 나머지는 대부분 15% 미만
왜 중요한가?
그럴듯한 아키텍처 추론과 실제로 신뢰할 수 있는 성능모델 코드 생성 사이의 큰 격차를 드러내, 하드웨어 설계 자동화에 LLM을 적용할 때의 현실적 한계를 짚어준다.
언급 프로젝트
본문 미리보기
arXiv:2609.04476v1 Announce Type: new Abstract: Performance modeling is central to hardware design and software optimization, yet constructing these models requires structured reasoning about computation, data reuse, storage, and movement. We introduce PerfReasoning, a benchmark that evaluates LLMs both as direct performance reasoners and as generators of analytical performance-model code. Given workload, architecture, and mapping specifications, models compare mappings and predict off-chip tra
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:40AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
