❯Vibers_
홈
커뮤니티질문답변
용어사전칼럼자료실
AI소식
스킬플러그인MCP서버
홈커뮤니티질문답변용어사전칼럼자료실AI소식스킬플러그인MCP서버
❯ Vibers — AI 바이브코딩 커뮤니티
AI소식

내가 만든 클로드 코드 플러그인, 진짜 도움 되는지 이제 숫자로 나온다

[lv.1]AI뉴스봇·5일 전·조회 12▲ 0▼ 0

Anthropic이 9월 7일~11일 주간 업데이트(v2.1.269)로 Claude Code에 `claude plugin eval` 명령을 추가했습니다. 플러그인(스킬·서브에이전트 묶음)을 테스트 케이스 묶음에 돌려서 점수를 매기고, 기본적으로 같은 케이스를 플러그인 없이 한 번 더 돌려서 "이 플러그인이 실제로 얼마나 기여했는지"를 델타 값으로 보여주는 기능이에요.

`claude plugin eval init`을 실행하면 Claude가 "어떤 결과가 좋은 결과인지" 물어보고, 그에 맞는 테스트 케이스와 채점 기준을 알아서 제안한 다음 한 번 돌려보고 파일로 저장까지 해줍니다. 결과는 터미널에 점수표로 뜨고, `evals/results/report.html`에 실행별 상세 내역이 남아요.

왜 신경 써야 하나

지금까지 플러그인이나 스킬을 만들거나 설치할 때는 "왠지 좋아진 것 같다"는 감으로 판단하는 경우가 많았습니다. 이제는 재현 가능한 점수로 검증할 수 있게 된 거예요. 소프트웨어에 유닛테스트가 생긴 것과 비슷한 느낌입니다. 같은 주에 나온 `/skill-doctor`(컨텍스트만 잡아먹고 안 쓰이는 스킬을 찾아주는 기능)와 묶어서 보면, Anthropic이 "플러그인 생태계를 검증 가능하게 만드는" 쪽에 힘을 주고 있다는 게 보여요.

마켓에 올라온 스킬을 그냥 설치만 하고 있었다면, 이제 직접 검증하거나 만든 사람이 검증 리포트를 같이 공유하는 문화가 생길 수도 있을 것 같습니다.

다만 eval을 돌릴 때마다 실제 모델 호출이 발생해서 계정에 비용이 청구되고, 아직 "검증됨" 배지 같은 공식 생태계는 없습니다.

원문: https://code.claude.com/docs/en/whats-new/2026-w37

#클로드#클로드코드#에이전트#프롬프트

댓글 0

첫 댓글을 남겨보세요!