코드 Eval (독립 평가)

SkillSecurity

Evaluates code output across 4 axes (functionality/quality/originality/security) and produces a score. Spawns an Evaluator agent to run an independent evaluation. Triggers on: eval, 평가, 품질 점수, 코드 평가, quality score. NOT for: 코드 작성, 구현, 리뷰.

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the 코드 Eval (독립 평가) skill

What this skill tells your AI

The instructions your AI receives, as published by jh941213/my-cc-harness in skills/eval/SKILL.md and read by ahel’s review.

Generator(구현자)와 분리된 Evaluator 에이전트를 스폰하여 산출물을 독립 평가합니다.

별도 모델로 평가 실행 방법: gemini CLI(설치되어 있으면) 또는 별도 새 세션에서 실행한다. 둘 다 불가하면 같은 세션이라도 생성 컨텍스트를 참조하지 않는 독립 서브에이전트로 실행한다.

실행 프로세스

Step 1: Evaluator 에이전트 스폰

Agent(subagent_type="evaluator",
  prompt="~/.claude/agents/evaluator.md를 읽고 현재 프로젝트를 평가하라.
         4축(기능 정확성/코드 품질/독창성/사용성&보안) 100점 만점.
         결과를 EVAL_REPORT.md에 저장.")

Step 2: 결과 확인

Evaluator가 완료되면 EVAL_REPORT.md를 읽고 사용자에게 요약 보고:

📊 Eval 결과: [PASS/CONDITIONAL/FAIL] — [N]/100점

기능 정확성: [N]/40 | 코드 품질: [N]/25
독창성: [N]/20 | 사용성&보안: [N]/15

[수정 필요 항목 요약]

Step 3: CONDITIONAL/FAIL 시

수정 필요 항목을 구체적으로 안내하고, 수정 후 재평가할지 질문. 재평가 시 동일 기준 적용 (최대 3라운드).

pass@k 멱등성 테스트 (선택)

동일 프롬프트로 k회 실행하여 품질 일관성을 측정:

# k=3 실행 예시
for i in 1 2 3; do
  /eval 실행 → 점수 기록
done
# 3회 모두 85+ → 멱등성 확보
# 점수 분산 > 15점 → 불안정 (하네스 조정 필요)

수준의 멱등성: 정확히 같은 코드가 아니라 같은 품질 수준이 유지되는지 측정.

Signals

GitHub stars
125
Forks
35
Last commit
Aug 2026
Advanced
Catalog kind
skill
Gateway key
eval-jh941213
Source
github.com/jh941213/my-cc-harness