+ 증거 부재를 정확히 구분하고 경계값 검사까지 제시했다.
- 네 가지 주장을 일곱 항목으로 나눠 집계 단위가 다소 흐려졌다.
끝났다고 말하려면 확인 가능한 산출물을 대게 합니다. 못 대면 미확인으로 표기합니다.
| 분류 | 개발 › 코딩 |
|---|---|
| 태그 | 검토체크리스트개발자 |
Audit these completion claims. For each claimed item, produce: - The claim - **Status: VERIFIED / UNVERIFIED / CONTRADICTED** - The evidence — the specific artifact that confirms it: a test name, an output, a log line, a URL, a file - If UNVERIFIED, the exact check I should run Rules: 1. *VERIFIED requires a named artifact I could open right now.* "The code handles it" is not evidence. "Test `x` passes" is. 2. Mark UNVERIFIED generously. It is not an accusation — it means nobody has looked yet. 3. CONTRADICTED is for claims the evidence argues against. 4. Where the acceptance criteria are vague enough that "done" cannot be judged, say so. *That is a finding about the criteria, and it is the most common reason work is called done and is not.* 5. Report a verification rate, not a completion rate. They are different numbers and only one of them is real. End with the single unverified item whose failure would cost the most.
AI든 사람이든 "완료"라는 말이 제일 안 믿긴다. 이 프롬프트는 각 항목마다 무엇을 보면 완료가 확인되는지를 요구하고, 증거가 없으면 미확인으로 남긴다. 완료율이 아니라 확인율이 나온다.
ChatGPT가 가장 신중하고 구체적이다. Gemini는 상세하지만 추정과 장황함이 있으며, [C]는 답이 없어 평가 불가다.
+ 증거 부재를 정확히 구분하고 경계값 검사까지 제시했다.
- 네 가지 주장을 일곱 항목으로 나눠 집계 단위가 다소 흐려졌다.
+ 항목별 검사 절차와 수용 기준의 모호성을 상세히 짚었다.
- 스키마·인프라·법적 과징금을 입력 근거 없이 가정했다.
| 기준 | ChatGPT | Gemini | 앞선 모델 |
|---|---|---|---|
| 지시 준수 | 9 | 9 | 동점 |
| 정확성 | 9 | 6 | ChatGPT +50% |
| 구체성 | 9 | 8 | ChatGPT +13% |
| 구성·가독성 | 9 | 8 | ChatGPT +13% |
| 분량 적정성 | 8 | 5 | ChatGPT +60% |
gpt-5.6-sol가 모델 이름을 가린 채 1~10점으로 채점했습니다 (2026-09-24). 측정값이 아니라 AI 심사 결과입니다.
같은 입력을 세 모델에 넣어 받은 답을 그대로 옮겼습니다. 각 CLI(에이전트 하네스)에서 실행했습니다. ChatGPT·Claude 앱이나 웹에서는 답이 다를 수 있습니다.
완료했다는 작업: 1. 회원 탈퇴 시 개인정보(이름, 전화번호, 이메일) DB 즉시 삭제 처리 완료 2. PG 결제 실패 시 최대 3회 재시도 로직 구현 완료 3. 관리자 페이지 주문 내역 CSV 다운로드 기능 완료 4. 비밀번호 재설정 이메일 발송 기능 완료 완료 기준: 탈퇴 요청 후 users, contacts 테이블에서 개인정보가 실제로 지워지거나 마스킹되어야 함 / 결제 실패 시 정확히 3회까지 재시도하고 이후 실패 알림이 발송되어야 함 / CSV에 최근 90일치 주문 데이터가 빠짐없이 포함되어야 함 / 비밀번호 재설정 링크는 발급 30분 후 만료되어야 함
현재 세션에서 열 수 있는 소스·테스트·로그·DB 결과가 제공되지 않아, 확인 가능한 완료 증거는 없습니다.
| 주장 | 상태 | 증거 | UNVERIFIED일 때 실행할 정확한 확인 |
|---|---|---|---|
| 회원 탈퇴 시 이름·전화번호·이메일을 DB에서 즉시 삭제 | UNVERIFIED | 확인 가능한 테스트명, SQL 결과, 로그, 파일 없음 | 테스트 계정으로 탈퇴 요청 후 즉시 SELECT name, phone, email FROM users ... 및 contacts 조회. 값이 NULL·마스킹 상태인지 확인하고, 탈퇴 전/후 결과를 저장하는 delete_personal_data_on_withdrawal 테스트를 통과시킬 것 |
| PG 결제 실패 시 최대 3회 재시도 | UNVERIFIED | PG mock 호출 횟수나 재시도 테스트 결과 없음 | PG 실패 mock으로 결제를 실행하고 PG 호출 횟수가 정확히 3회인지 검증. 초기 결제 시도를 포함한 횟수인지, 재시도만 3회인지 완료 기준부터 명확히 해야 함 |
| 3회 실패 후 실패 알림 발송 | UNVERIFIED | 알림 발송 로그, 큐 메시지, 알림 테스트 결과 없음 | PG를 3회 연속 실패시키고 payment_failed 알림 이벤트/메일/SMS가 정확히 1회 발행되는지 확인. 결제 호출 수와 알림 수를 함께 검증 |
| 관리자 페이지에서 주문 내역 CSV 다운로드 | UNVERIFIED | 다운로드 URL, 파일, 엔드포인트 테스트 없음 | 최근 90일 경계 안팎의 주문 fixture를 생성한 뒤 CSV를 다운로드하고, DB 조회 결과의 주문 ID 전체와 CSV 행을 비교. 누락·중복·필드 인코딩도 검증 |
| CSV에 최근 90일 주문이 빠짐없이 포함 | UNVERIFIED | CSV 샘플 또는 비교 결과 없음 | 기준 시각과 시간대를 고정하고 now - 90 days 직전·정확히 경계·직후 주문을 생성해 포함 여부를 확인. 취소/환불/페이지네이션 주문의 포함 규칙도 명시해야 함 |
| 비밀번호 재설정 이메일 발송 | UNVERIFIED | 메일 발송 로그, 메일 fixture, 발송 테스트 없음 | 테스트 계정으로 재설정 요청 후 메일 provider mock의 수신자·발송 횟수·링크를 검증하고, 링크가 실제로 비밀번호 변경에 사용되는지 확인 |
| 비밀번호 재설정 링크가 발급 30분 후 만료 | UNVERIFIED | 만료 테스트 결과 또는 토큰 검증 코드의 테스트 없음 | 시간을 고정한 테스트에서 발급 시각 t, t+29:59, t+30:00, t+30:01에 링크를 사용해 t+30:00 이후 거부되는지 확인. 토큰 재사용도 함께 검증 |
완료 기준 자체에도 판단 불가 요소가 있습니다.
검증률: 0/4 주장 = 0%
이는 완료율이 아니라, 현재 열 수 있는 명명된 artifact로 검증된 비율입니다.
가장 실패 비용이 큰 미검증 항목은 PG 결제 실패 시 재시도 횟수와 3회 후 실패 알림입니다. 잘못 구현되면 중복 결제 시도, 고객 피해, 미처리 결제가 동시에 발생할 수 있습니다.
| 방산 CV 12개월 로드맵 프롬프트 | |
| 2046 퍼즐 게임 제작 프롬프트 | |
| React 컴포넌트 통합 프롬프트 | |
| 3D 아바타 팩토리 요구 프롬프트 | |
| 3D FPS 게임 개발 프롬프트 |