35/ 50
+ 불확실한 수치를 미확인으로 구분해 신중하다
- 근접 모델·점수가 빠졌고 일부 주장도 출처가 모호하다
AI 모델명을 넣으면, 출시일, 파라미터, 구조, 컨텍스트, 기능, 벤치마크, 경쟁 모델, 출처를 조사해 목록으로 정리합니다.
| 분류 | AI 사용법 › 딥리서치 |
|---|---|
| 태그 | 분석요약개발자 |
Ask me for AI model name(s) in next message * You are an AI model research expert. You must research and provide actual and accurate data, never make up any data. * research and list the specification of the AI model (use markdown bullets, do not use table) * basic: release date, parameter size, dense or MoE, context window, modality, * capabilities: text chat, vision, search, reasoning, function calling, embed, rerank * benchmark: SWE-Brench-Pro, SWE-Brench-Pro, LiveBench. for each benchmark list 2 other models ranked close to it. * list 5 popular similar/competitive model (write model-id only) with similar parameter size and capabilities. * list the source where you got your source data from.
모델 사양을 비교하기 위한 모델 카드 작성용이다. 실제 자료만 쓰라고 강조하고 벤치마크 주변 모델까지 요구하지만, 최신 정보 확인이 필요하다.
Claude는 미확인을 명시해 가장 안전하지만 요구 데이터가 부족하다. ChatGPT는 정확하나 과업을 거의 수행하지 않았고, Gemini는 형식은 충실하지만 심각한 환각이 많다.
+ 불확실한 수치를 미확인으로 구분해 신중하다
- 근접 모델·점수가 빠졌고 일부 주장도 출처가 모호하다
+ 요구 항목을 카드별 불릿으로 빠짐없이 정리했다
- 모델명·수치·기술 설명 다수가 근거 없는 창작으로 보인다
+ 추가 사실을 만들지 않아 정확성 위험이 없다
- 이미 제시된 모델명을 다시 물어 비교 요청을 수행하지 않았다
| 기준 | ChatGPT | Claude | Gemini | 앞선 모델 |
|---|---|---|---|---|
| 지시 준수 | 3 | 7 | 8 | Gemini +14% |
| 정확성 | 10 | 6 | 1 | ChatGPT +67% |
| 구체성 | 2 | 7 | 8 | Gemini +14% |
| 구성·가독성 | 8 | 8 | 8 | 동점 |
| 분량 적정성 | 4 | 7 | 6 | Claude +17% |
gpt-5.6-sol가 모델 이름을 가린 채 1~10점으로 채점했습니다 (2026-09-24). 측정값이 아니라 AI 심사 결과입니다.
같은 입력을 세 모델에 넣어 받은 답을 그대로 옮겼습니다. 각 CLI(에이전트 하네스)에서 실행했습니다. ChatGPT·Claude 앱이나 웹에서는 답이 다를 수 있습니다.
[붙여 넣은 자료] Claude Opus 5.5, GPT-5.5, Gemini 3 Pro 이렇게 세 개 비교해서 카드 만들어주세요
비교할 AI 모델 이름을 알려주세요. 예: Claude Opus 5.5, GPT-5.5, Gemini 3 Pro
| 연구 데이터 분석 역할 프롬프트 | |
| 요약 후 심층분석 프롬프트 | |
| 심층 조사 에이전트 역할 프롬프트 | |
| 심층 리서치를 맡기는 프롬프트 | |
| Gemini 심층 연구 프롬프트 |