앤스로픽, 클로드 코드에 '플러그인 평가' 기능 추가… 6종 채점기로 스킬 성능 검증
앤스로픽이 클로드 코드(Claude Code)용 플러그인 평가(evals) 워크플로를 새로 공개했다고 마크테크포스트(MarkTechPost)가 11일 보도했다.
보도에 따르면 새로 추가된 `claude plugin eval` 명령은 플러그인을 실제 사용 상황에 가까운 프롬프트로 실행한 뒤 클로드가 내놓은 결과를 채점하고, 플러그인을 적용하지 않은 상태의 실행 결과와 비교한다. 스킬이 실제로 작동하는지, 코드 수정이나 모델 교체 이후에도 유지되는지, 플러그인 없는 기본 모델보다 나은 성능을 내는지를 수치로 확인할 수 있다는 것이 앤스로픽의 설명이다.
평가 항목은 플러그인 내부의 `evals/` 디렉터리에 저장되며, 각 사례는 프롬프트 파일과 채점기(graders) 폴더로 구성된다. 채점기는 모두 6종이다. 이 가운데 정규식, 도구 사용 여부, 도구 호출 순서, 파일 존재 여부 등 4종은 실행 기록과 디스크상의 파일만으로 계산돼 추가 비용이 들지 않는다. 나머지 2종은 판정용 모델을 호출하기 때문에 요금이 발생한다.
기본 설정에서는 각 사례가 플러그인을 적용한 상태와 적용하지 않은 상태로 두 번씩 실행되며, 두 결과의 차이(Δ)가 플러그인의 기여분으로 간주된다. 양쪽 모두 만점이 나오면 플러그인 때문에 통과한 것이 아니라는 의미다. 앤스로픽은 가장 흔히 발견되는 문제로 Δ가 0에 가까우면서 스킬 호출 채점기가 실패하는 경우를 꼽았다. 이는 자연스러운 표현으로 요청했을 때 클로드가 해당 스킬을 선택하지 않는다는 뜻으로, 매니페스트 문법과 스키마만 검사하는 기존 검증 명령으로는 잡아낼 수 없는 결함이다.
해당 기능은 클로드 코드 v2.1.269 이상에서 사용할 수 있으며, 평가 실행과 판정 모델 호출은 모두 실제 모델 호출로 이용자의 요금제나 API 계정에 과금된다. 평가 결과는 보고서 형태로 저장된다.
김성진 메타브리프 기자 metabrief.kr@gmail.com