Epix / 업무·마케팅 운영
Claude Opus 5.5 실제 업무 테스트표: 코드·문서·스프레드시트 평가 템플릿
Claude Opus 5.5를 도입하기 전에 코드, 문서, 데이터 정리 업무를 같은 조건으로 비교하는 평가표와 합격 기준을 제공합니다.
업데이트: 2026년 9월 23일
테스트 원칙: 벤치마크 점수보다 실제로 반복하는 업무 20개를 고정하고, 결과 품질·수정 시간·토큰 사용량·실패 복구를 동시에 기록하세요.
평가표 열
| 열 | 기록할 값 |
|---|---|
| task_id | 업무 샘플 식별자 |
| input_version | 입력 파일·프롬프트 버전 |
| quality_score | 정확성·누락·형식 점수 |
| human_minutes | 사람이 수정한 시간 |
| tokens·latency | 입출력량과 완료 시간 |
| failure_recovery | 실패 후 복구 가능 여부 |
업무별 샘플
- 코드: 테스트가 있는 작은 기능 수정, 의존성 업그레이드, 오류 로그 원인 분석.
- 문서: 긴 회의록에서 결정사항·담당자·기한 추출.
- 스프레드시트: 중복·누락 표시, 열 정규화, 보고서 요약.
- 운영: 권한 없는 요청 거절, 실패 시 이전 상태 복구.
합격 기준 예시
품질 점수 90점 이상, 사람 수정 5분 이하, 핵심 누락 0건, 실패 시 원본 훼손 없음처럼 업무에 맞는 최소 기준을 정합니다. 기준을 통과한 샘플 비율과 평균 비용을 함께 봐야 모델 교체의 경제성을 판단할 수 있습니다.
Anthropic의 Opus 5.5 발표는 복잡한 작업 성능 향상을 설명하지만, 발표 수치가 자신의 데이터셋을 대신하지는 않습니다.
결과를 의사결정으로 연결하기
- 현재 모델을 기준선으로 저장합니다.
- 새 모델을 동일 조건으로 20개 샘플 실행합니다.
- 품질 개선이 인건비·API 비용 증가보다 큰지 계산합니다.
- 통과한 업무만 새 모델로 라우팅합니다.