☰ Categories

Build A/B test pairs that isolate one variable

Holds everything but one variable constant and names what each test would actually tell you.

CategoryMarketing › Ad copy
TagsDraftingAnalyzingMarketer
Prompt
Build A/B test pairs.

1. **First propose the variables worth testing** — emphasis, tone, length, presence of a number, the call to action.
2. Per variable, write A and B. ***Hold everything else identical.*** **Changing more than one variable at a time makes the result uninterpretable.**
3. Per pair:
   - The one variable changed
   - **What this test would tell you**
   - Which you expect to win and why — **marked clearly as a prediction**
4. Recommend the test order — the variable with the largest expected effect first.
5. **Say what sample size would be needed before the result means anything.** *Calling a winner on a small sample is how teams learn the wrong lesson.*
After pasting, fill in the fields at the bottom (Product · Current copy · Medium)

What this prompt does

Changing three things at once produces a winner you cannot explain. This isolates one variable per pair and warns about sample size.

Model comparison

Claude is strongest on controls, measurement, and sample sizing. Gemini is specific but invents claims, while ChatGPT has major flaws in its CTA test and sample-size guidance.

ClaudeTop overall
43/ 50

+ Strongest hypotheses, metrics, and sample-size rationale.

- Some pairs alter wording beyond emphasis, and the answer runs long.

Gemini
38/ 50

+ Clearly explains each test’s intent and expected response.

- Invented “15 minutes” and “70%” claims undermine accuracy.

ChatGPT
36/ 50

+ Concise structure makes the five variables and order easy to scan.

- The CTA pair is not isolated, and sample guidance is far too small.

CriterionChatGPTClaudeGeminiLeader
Instruction following798Claude +13%
Accuracy596Claude +50%
Specificity899Tie
Structure899Tie
Right length876ChatGPT +14%

Scored 1–10 by gpt-5.6-sol with model names hidden (2026-09-24). This is an AI review, not a measurement.

Read full answers

We gave three models the same input and copied their answers unedited. Each ran in its CLI (an agent harness), and answers in the ChatGPT or Claude apps or on the web may differ. Outputs are in Korean.

Input used
Product: 홈트레이닝 앱 '핏레이' 1개월 무료체험 구독

Current copy: 지금 시작하면 한 달 무료! 핏레이와 함께 집에서 운동하세요.

Medium: 인스타그램 피드 광고
gpt-5.6-luna (codex CLI · 에이전트 하네스) · Run on 2026-09-24

먼저 테스트할 변수

예상 효과가 큰 순서대로 다음 순서를 권합니다.

  1. 혜택의 강조점
  2. CTA
  3. 톤
  4. 길이
  5. 숫자 표기 방식/숫자 유무

모든 광고는 동일한 타깃, 예산, 게재 위치, 이미지·영상, 노출 기간으로 운영해야 합니다. 측정 기준은 클릭률보다 최종적으로 무료체험 시작률 또는 구독 전환율을 우선하세요.


1. 강조점 테스트

A

지금 시작하면 한 달 무료! 핏레이와 함께 집에서 운동하세요.

B

집에서 편하게 운동하세요! 핏레이를 지금 시작하면 한 달 무료입니다.

  • 변경 변수: 무료 혜택 강조 → 집에서 운동하는 편의성 강조
  • 이 테스트가 알려주는 것: 사용자가 더 강하게 반응하는 메시지가 경제적 혜택인지 홈트레이닝의 편리함인지 알 수 있습니다.
  • 예측: A 승리
  • 이유: 인스타그램 피드에서 “한 달 무료”는 즉시 이해되는 구체적 혜택이며, 가입 동기를 직접적으로 자극할 가능성이 높습니다.

2. CTA 테스트

A

지금 시작하면 한 달 무료! 핏레이와 함께 집에서 운동하세요.

B

지금 시작하면 한 달 무료! 핏레이와 함께 집에서 운동해보세요.

  • 변경 변수: CTA의 직접성
  • 이 테스트가 알려주는 것: 강한 행동 촉구가 가입을 유도하는지, 부담이 낮은 표현이 더 많은 반응을 얻는지 알 수 있습니다.
  • 예측: A 승리
  • 이유: 무료체험 상품은 즉시 행동을 유도하는 표현이 잘 맞고, “지금 시작”은 긴급성과 명확성이 있습니다.

3. 톤 테스트

A

지금 시작하면 한 달 무료! 핏레이와 함께 집에서 운동하세요.

B

지금 시작하면 한 달 무료! 핏레이와 함께 집에서 운동해요.

  • 변경 변수: 격식 있고 지시적인 톤 → 친근하고 대화적인 톤
  • 이 테스트가 알려주는 것: 핏레이 이용자에게 전문적이고 명확한 말투와 친근한 말투 중 어느 쪽이 더 신뢰와 행동을 이끄는지 알 수 있습니다.
  • 예측: B 승리
  • 이유: 인스타그램은 개인적이고 대화적인 매체이므로 “운동해요”가 심리적 거리를 줄일 가능성이 있습니다.

4. 길이 테스트

A — 짧은 버전

지금 시작하면 한 달 무료! 핏레이와 함께 집에서 운동하세요.

B — 긴 버전

지금 시작하면 한 달 무료! 별도 이동 없이 원하는 시간에 핏레이와 함께 집에서 운동하세요.

  • 변경 변수: 메시지 길이
  • 이 테스트가 알려주는 것: 사용자가 짧고 빠르게 이해되는 광고를 선호하는지, 추가적인 사용 편의성 설명이 설득력을 높이는지 알 수 있습니다.
  • 예측: A 승리
  • 이유: 피드 광고에서는 긴 문구가 핵심 혜택의 즉시성을 떨어뜨릴 수 있습니다.

5. 숫자 표기 테스트

숫자 유무를 엄밀히 비교하려면 다른 표현을 최대한 동일하게 유지해야 합니다.

A

지금 시작하면 1개월 무료! 핏레이와 함께 집에서 운동하세요.

B

지금 시작하면 무료 체험! 핏레이와 함께 집에서 운동하세요.

  • 변경 변수: 구체적인 기간 숫자 표시 여부
  • 이 테스트가 알려주는 것: “1개월”이라는 구체성이 가입 판단을 돕는지, 기간을 생략한 “무료 체험”이 더 자연스럽고 부담 없이 느껴지는지 알 수 있습니다.
  • 예측: A 승리
  • 이유: “1개월”은 혜택의 가치를 구체적으로 보여주므로 사용자가 제안을 더 쉽게 비교하고 이해할 수 있습니다.

단, 이 쌍은 숫자뿐 아니라 “무료”와 “무료 체험”의 표현도 약간 달라집니다. 숫자 유무를 더 엄밀하게 검증하려면 실제 광고 플랫폼에서 문구 길이와 표현을 추가로 맞춘 별도 실험을 설계해야 합니다.


권장 테스트 순서

  1. 강조점
  2. CTA
  3. 톤
  4. 길이
  5. 숫자 표기

각 테스트에서 승자를 정한 뒤 다음 테스트로 넘어가야 합니다. 여러 변수를 동시에 바꾸거나, A/B 결과가 나오기 전에 다음 실험을 시작하면 어떤 변화가 성과를 만들었는지 해석하기 어렵습니다.

필요한 표본 크기

작은 표본에서 승자를 선언하지 마세요. 최소 기준으로는 각 버전에 다음 정도가 필요합니다.

  • 클릭률만 비교: 버전당 최소 1,000~2,000회 노출
  • 무료체험 시작률 비교: 버전당 최소 3,000~5,000회 노출
  • 무료체험 전환율이 약 3%이고, 약 2025%의 상대적 개선을 발견하려는 경우: 버전당 대략 4,0006,000명 이상의 유효 방문자

가능하면 각 버전에 최소 100건 이상의 전환이 쌓일 때까지 기다리세요. 또한 통계적으로 유의한 차이와 함께 95% 신뢰수준을 확인하고, 하루나 이틀의 일시적 성과만으로 승자를 결정하지 않는 것이 좋습니다.

More in this category

Write copy for different audience segments
Turn features into benefits, one rung at a time
Define a brand tone and apply it
Check ad copy for unsupported claims
Write copy that contrasts with a competitor