9월 11일 자 Claude Code 업데이트(v2.1.269)에 눈에 띄는 커맨드가 하나 추가됐습니다. `claude plugin eval`. 플러그인의 eval suite를 Claude Code 위에서 직접 돌려서, 점수화되고 재현 가능한 결과를 JSON과 HTML 리포트로 뽑아주는 기능입니다.
왜 이게 필요했냐면, 그동안 Claude Code 플러그인·스킬 생태계가 빠르게 커지면서도 "이 플러그인이 실제로 잘 동작하는지"를 객관적으로 검증할 표준 도구가 없었습니다. 다들 그냥 직접 써보고 감으로 판단하는 수준이었죠. 이번 업데이트로 플러그인을 만드는 사람이 자기 플러그인의 성능을 숫자와 리포트로 보여줄 수 있게 됐고, 이건 마켓플레이스에 플러그인을 올릴 때 신뢰도를 어떻게 확보하느냐는 문제와 바로 연결됩니다.
같은 업데이트에서 `/output-style [name]`도 확장돼서, CLI뿐 아니라 Remote Control이나 클라우드·헤드리스 세션에서도 출력 스타일을 바로 전환할 수 있게 됐습니다. 그리고 Workflow 툴의 동시 에이전트 상한을 `CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS` 환경변수로 최대 256까지 올릴 수 있게 됐고요. 둘 다 방향성은 비슷합니다 — 사람이 화면 앞에 안 붙어있어도 돌아가는 자동화·원격 워크플로우가 점점 늘어나는 흐름에 맞춘 변화입니다.
체감되는 변화는 이렇습니다. 플러그인을 만들고 있다면 `claude plugin eval --help`로 바로 테스트해볼 수 있고, 이 리포트를 CI에 붙여서 회귀 테스트처럼 쓸 수 있습니다. 대량 파일을 훑는 것 같은 팬아웃(fan-out) 작업을 Workflow로 돌릴 때도 동시 실행 상한이 늘어난 만큼 대기 시간이 줄어들 여지가 생겼고요.
다만 eval suite 자체는 기본 제공되는 게 아니라 플러그인 개발자가 직접 작성해야 합니다. 그리고 이 점수를 마켓플레이스에서 배지나 랭킹처럼 자동으로 노출해주는 기능은 아직 공개되지 않았습니다 — 지금은 어디까지나 개발자가 로컬에서 돌려보는 검증 도구 단계입니다.
댓글 0
첫 댓글을 남겨보세요!