한국어 요약by Claude · 2026. 9. 27.
사이먼 윌리슨이 제시 빈센트의 Prime Radiant 연구소와 함께 개발한 소형 평가 프레임워크 'smevals'를 공개했다. 모델·프롬프트·에이전트 하네스의 성능을 비교하기 위한 도구로, uvx smevals run으로 여러 모델 설정에 대해 실행하고, uvx smevals grade로 정의한 체크 기준에 따라 채점한 뒤, serve나 build 명령으로 결과를 로컬 웹서버나 정적 HTML 리포트로 확인할 수 있다. 평가(eval)는 과제(task)들의 모음이며, 각 과제를 여러 설정(config: 모델·시스템 프롬프트·파라미터 등)으로 실행한 결과가 실행 기록(run)이 되고, 이를 문자열 검사나 XML 유효성 검사, 심지어 다른 모델을 활용한 채점기(grader)로 평가하는 구조다. 그는 이번이 평가 도구에 대한 세 번째 시도이며 이번 버전이 가장 만족스럽다고 밝혔다.
- •제시 빈센트의 Prime Radiant 연구소와 공동 개발한 소형 모델 평가 프레임워크 smevals 공개
- •YAML 기반 eval 디렉토리로 정의, uvx smevals run/grade/serve/build 명령으로 실행·채점·리포트 생성
- •task-config-run-grader 구조로 문자열 검사부터 다른 모델을 활용한 채점까지 유연하게 지원
- •평가 도구에 대한 세 번째 시도로, 이번 버전이 가장 만족스럽다고 평가
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
smevals - a small eval suite for evaluating models, prompts, and harnesses
출처:Simon Willison's Blog
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
공유:
이 글이 만들어진 과정
- 10:32AI 초안

