26/ 50
+ 수행 불가 사유를 짧고 분명하게 밝혔다.
- 요구된 커밋·푸시·PR 작업을 전혀 완료하지 않았다.
현재 git 상태, diff, 브랜치, 최근 커밋을 바탕으로 변경사항을 검토해 conventional commit으로 커밋하고 push한 뒤 main 대상 PR을 열도록 합니다.
| 분류 | 개발 › 배포·운영 |
|---|---|
| 태그 | 검토초안작성개발자코드 |
--- allowed-tools: Bash(git add:*), Bash(git status:*), Bash(git commit:*), Bash(git push:*), Bash(gh pr create:*) description: Commit and push everything then open a PR request to main --- ## Context - Current git status: !`git status` - Current git diff (staged and unstaged changes): !`git diff HEAD` - Current branch: !`git branch --show-current` - Recent commits: !`git log --oneline -10` ## Your task 1. Review the existing changes and then create a git commit following the conventional commit format. If you think there are more than one distinct change you can create multiple commits. If there are no outstanding changes proceed to 2. 2. Push all commits. 3. Open a PR to main following the conventional formats.
Claude Code 슬래시 명령으로 작업 종료 절차를 자동화할 때 쓰기 좋다. git add/status/commit/push와 gh pr create 도구만 허용하는 메타데이터가 포함되어 있다.
Gemini는 형식적 안내뿐이며 입력에 없는 내용을 창작했다. ChatGPT는 정직하고 간결하지만 작업을 수행하지 않았고, [C]는 답이 없다.
+ 수행 불가 사유를 짧고 분명하게 밝혔다.
- 요구된 커밋·푸시·PR 작업을 전혀 완료하지 않았다.
+ 절차와 Conventional Commit 형식은 명확하다.
- 작업을 수행하지 않고 인증 기능 등을 지어냈다.
| 기준 | ChatGPT | Gemini | 앞선 모델 |
|---|---|---|---|
| 지시 준수 | 2 | 2 | 동점 |
| 정확성 | 6 | 2 | ChatGPT +200% |
| 구체성 | 3 | 1 | ChatGPT +200% |
| 구성·가독성 | 7 | 7 | 동점 |
| 분량 적정성 | 8 | 3 | ChatGPT +167% |
gpt-5.6-sol가 모델 이름을 가린 채 1~10점으로 채점했습니다 (2026-09-24). 측정값이 아니라 AI 심사 결과입니다.
같은 입력을 세 모델에 넣어 받은 답을 그대로 옮겼습니다. 각 CLI(에이전트 하네스)에서 실행했습니다. ChatGPT·Claude 앱이나 웹에서는 답이 다를 수 있습니다.
현재 환경에서는 git/gh 실행 도구가 제공되지 않고 파일 시스템도 읽기 전용이라, 변경 검토·커밋·푸시·PR 생성을 수행할 수 없습니다.
| 프로덕션 AI 에이전트 설계 프롬프트 | |
| AI 에이전트 보안 점검 프롬프트 | |
| AI 제공자 요금 조사 프롬프트 | |
| 상자 탈출 AI 역할을 맡기는 프롬프트 | |
| 보안 경고 분석 프롬프트 |