앤트로픽이 코딩 에이전트 '클로드 코드'에 플러그인의 실제 작동 여부와 기여도를 검증하는 '플러그인 평가(Plugin Evals)' 기능을 v2.1.269부터 추가했다. 기존 유효성 검사가 설정 파일의 문법만 확인했다면, 새 기능은 'claude plugin eval' 명령으로 플러그인 적용(WITH)과 미적용(W/OUT) 상태의 결과를 비교해 그 차이(Δ)로 실제 기여도를 측정한다. 평가자는 regex, tool_used 등 무료 4종과 별도 모델 호출이 필요한 llm·baseline 등 총 6종으로 구성되며, CI/CD 파이프라인에서는 점수 기준과 비용 한도를 설정해 품질 게이트로도 활용할 수 있다. 앤트로픽은 실제 평가에서 자연스러운 요청에 스킬이 호출되지 않아 Δ가 0에 가까운 경우가 흔한 문제로 발견됐다고 밝혔다.
- •앤트로픽, 클로드 코드 v2.1.269부터 플러그인 실제 성능·기여도 검증하는 '플러그인 평가' 기능 추가
- •플러그인 적용(WITH)과 미적용(W/OUT) 결과 차이(Δ)로 실질 기여도 측정
- •평가자 6종(무료 4종+유료 llm·baseline), CI/CD에서 점수·비용 기준으로 품질 게이트 활용 가능
- •실제 평가에서 자연스러운 요청에 스킬이 호출되지 않아 Δ가 0에 가까운 사례가 흔한 문제로 확인
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
앤트로픽, 클로드 코드 '플러그인 평가' 공개…플러그인 성능·기여도 검증
- 1.앤트로픽, 클로드 코드 v2.1.269에 '플러그인 평가' 기능 추가…'claude plugin eval' 명령 실행
- 2.플러그인 적용(WITH)과 미적용(W/OUT) 결과를 비교해 실제 기여도(Δ)를 측정하는 방식
- 3.regex·tool_used·tool_order·file_exists 등 4종은 무료, llm·baseline 2종은 모델 호출 비용 발생
- 4.'--threshold'·'--max-cost-usd' 옵션으로 CI/CD 파이프라인의 품질·비용 게이트로도 활용 가능
왜 중요한가?
기존 'claude plugin validate'는 매니페스트 문법만 검증했지만, 이번 기능은 스킬이 실제로 호출되고 기본 모델보다 나은 성과를 내는지까지 검증해 플러그인 생태계의 신뢰성을 높인다.
언급 프로젝트
앤트로픽의 플러그인 평가 기능 공개는 국내 AI 서비스 개발사들에게 중요한 시사점을 던집니다. 실제 성능 검증의 중요성이 부각되면서, 국내 기업들도 AI 에이전트와 플러그인의 신뢰성 확보에 더욱 주력할 것으로 보입니다. 이는 곧 국내 AI 생태계 전반의 품질 향상으로 이어질 것입니다.
본문 미리보기
앤트로픽이 코딩 에이전트의 플러그인이 실제 작업에서 제대로 작동하는지를 검증할 수 있는 평가 기능을 추가했다. 기존의 플러그인 유효성 검사가 설정 파일의 문법과 스키마에 초점을 맞췄다면, 이번 기능은 플러그인이 실제 프롬프트에서 호출되는지와 모델의 기본 성능보다 효과가 있는지까지 측정할 수 있다는 점이 특징이다. 앤트로픽은 10일(현지시간) 코딩 에이전트 '클로드 코드'에 플러그인의 실제 성능을 검증할 수 있는 새로운 평가 기능을 추가했다. 해당 기능은 클로드 코드 v2.1.269 버전부터 사용할 수 있다.플러그인 개발자는 이제 실
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안

