ブログ
A/Bテスト、方向性テスト、それともリリースだけ?ソロマーケターのためのリスクベースのフレームワーク
完全なA/Bテストを実行するとき、方向性の確認で十分なとき、テストなしでリリースするとき——「間違えるコスト」に基づいて判断します。
概要
多くのA/Bテストのアドバイスは、無限のトラフィックと忍耐強いチームがいることを前提にしています。実際には、一人マーケターは、本格的な実験、短い方向性テスト、テストなしでの変更のリリースの間で選択しなければならないことがよくあります。この記事では、「間違えるコスト」と「待つコスト」を軸にした、その判断のためのリスクベースのフレームワークを紹介します。結果が「統計的に有意でない」場合にどうするか、それがなぜ「変更が失敗した」ことと同じではないのかを解説します。早い段階での確認が有用な場合、証拠を待つよりも今リリースする方がよい場合、テストを省略した場合の前後比較の測定方法についても学べます。重要なのは、テストを減らすことではなく、証拠の基準を実際のリスクに合わせることです。
あなたはA/Bテストを実行すべきでしょうか、それとももっと短い「方向性」テストを実行すべきでしょうか、あるいは単に変更して結果を見守るべきでしょうか? あなたがウェブサイトのコンバージョン率に責任を持ち、周りに専任チームがいない場合、これはおそらく最も頻繁に下す判断です。標準的なアドバイスは「すべてをテストする」というものですが、そのアドバイスは、余裕のあるトラフィック、待つ時間、監視すべき明確な指標があることを前提にしています。しかし、あなたにはそのどれもないことが多いでしょう。この記事では、3つの証拠基準を説明し、数日ではなく数分で選択できる方法を提供します。
まず理解すべきことは、A/Bテストは本当は変更そのものについてではないということです。それは、間違うためにいくら払うつもりがあるかについてです。同じサイトで2つの変更を考えてみましょう。あなたはプロジェクト管理ツールを運営しています。ホームページの見出しを「プロジェクトを管理」から「プロジェクトを半分の時間で計画」に変更したいとします。また、価格ページを変更して、月払いに加えて年払いプランを選べるようにしたいとします。どちらの変更も同じウェブサイトに影響し、同じ方法でテストできます。しかし、間違えることのコストは大きく異なります。見出しが間違っていた場合、訪問者は数日間、少し効果の低いメッセージを見るだけで、古いものに戻すのは簡単です。価格体系が間違っていた場合、潜在顧客を混乱させ、サポートに質問が殺到し、実際の請求方法と合わない期待を生むかもしれません。ロールバックは無料ではありません。同じロジックは、ボタンのラベルからページ全体のリデザインまで、検討するすべての変更に当てはまります。
だからこそ、「テストすべきか?」に対して誰も万能の答えを出せないのです。答えは、偽陽性のコスト、偽陰性のコスト、そして待っている間に何を犠牲にするかによって異なります。3つの選択肢を詳しく見ていきましょう。
本格的な実験:証拠のハードルが高いとき
メインのサインアップページのボタンを「無料トライアルを開始」から「始める」に変更するかどうかをテストしていると想像してください。一人創業者にとって、これはファネルの入口に位置する影響の大きい変更です。トライアル登録に影響を与え、その後のすべてに波及する可能性があります。訪問者は安定して訪れますが、それほど多くはありません。これは本格的な実験に適した候補です。
本格的な実験には明確な意味があります。訪問者をランダムに分け、一方のグループには元のバージョンを、もう一方のグループには変更後のバージョンを見せ、開始前に選択した指標で行動を比較します。Optimizelyの用語集で定義されているように、A/Bテストとは、ウェブページやアプリの2つのバージョンを比較して、どちらがより良いパフォーマンスを発揮するかを判断する方法です。重要なのは、直感ではなくデータに判断させることです。具体的には、明確な主要指標(たとえば、サインアップフォームまでクリックした訪問者の割合)を設定し、一度に1つの変数だけを変更することです。ボタンと周囲のコピーの両方を変更した場合、どちらが違いを生んだのかわかりません。また、どのくらいの期間実行し、どのような証拠があれば行動するのかを事前に決める必要があります。
この最後のステップは、ほとんどの人が飛ばしてしまうものです。開始する前に、必要な信頼水準と、検出しようとしている効果の大きさを決める必要があります。サンプルサイズと期間の背後にある統計的な仕組みこそが、A/Bテストを単なる観察と区別するものです。トラフィックが少なすぎて、妥当な期間内にその証拠に到達できない場合、本格的な実験はおそらく「結論が出ない」で終わるでしょう。それは現実のコストです。十分に待ったかどうかを判断する方法の詳細については、「A/Bテストをいつ止めるべきか」に関する実践的なフレームワークがこの記事と併せて参考になります。
ここには微妙な罠があります。本格的な実験が終了し、結果が「統計的に有意でない」場合、「変更は重要ではない」と結論づけたくなるかもしれません。しかし、それは結果の意味するところではありません。それは、テストの精度が差を検出するのに十分でなかったか、差があなたが気にするほど小さかったことを意味します。これは有益な情報です。他の証拠に基づいてリリースするか、より長いテストを実行するか、より実質的な変更を選ぶかを判断できます。しかし、新しいバージョンが悪いという証明にはなりません。トラフィックを動的に割り当ててバリアントを生成するAI搭載のテストプラットフォームを使用している場合、実験はより早く結論に達するかもしれませんが、同じロジックが適用されます。結果は、十分な証拠を待つあなたの能力と同じ程度にしか信頼できません。
また、学んだことを記録するという規律もあります。記録していないテストは、偏りを持って語り直すストーリーになります。たとえ結論が出ないテストでも、ページ上で実際に検出できる効果の大きさ、トラフィック、訪問者の忍耐について何かを教えてくれます。仮説、バリアント、指標、結果を一文で書き留めてください。数か月後には、そのログはあなたのオーディエンスが何に反応するかの地図となり、将来のすべての意思決定を速くします。
方向性テスト:スピードも答えの一部であるとき
次に、よりリスクの低い変更を考えてみましょう。ランディングページのヒーロー画像です。ダッシュボードのスクリーンショットと、製品を使っている人の写真という2つの選択肢があります。どちらがオーディエンスに響くかはわかりません。間違った画像を選んだ場合のデメリットは小さいです。数分で元に戻せます。しかし、1か月以内に教科書的な信頼水準の結果に達するほど十分なトラフィックがないかもしれません。ここが方向性テストの出番です。
方向性テストもランダム化比較ですが、意図的に低い証拠のハードルを使います。1週間の期間の大半で主要指標が良ければ新しい画像をリリースする、または一定期間の終わりに明確にリードしていればリリースする、と事前に決めておきます。結果は「判定」ではなく「推奨」として扱います。規律は本格的な実験と同様に重要です。事前にルールを決めていないと、ライブの結果を見つめて計画外の判断を下すことになります。それは、自分が見たいものを見るように自分を欺く方法です。
ここで、ほとんどのA/Bテストガイドにあるアドバイスを思い出してください。「テスト完了前に結果を覗き見するな」というものです。このアドバイスは、大きなローンチを左右する正式な実験には正しいものです。しかし、トラフィックがそこそこしかない一人マーケターにとっては、覗き見こそが素早く学ぶ方法です。問題は、数字を見たことではありません。問題は、見たことで計画していなかった判断をしてしまうことです。どのようなパターンがあれば考えを変えるかを事前に決めておけば、「覗き見」に見えるものは、実は低トラフィックに対処する構造化された方法になります。あなたは確実性よりも学習スピードを選んでいるのです。自分が何をしているかに正直で、結果を証明として発表しない限り、これは正当なトレードオフです。
方向性テストの後も、測定をやめないでください。新しいヒーロー画像をリリースしたら、その後数週間、コンバージョン率に目を光らせてください。悪化したら元に戻します。改善したら、方向性シグナルが正しかったというある程度の証拠になります。方向性テストは、素早く判断するための方法であり、説明責任を逃れるためのものではありません。また、一人マーケター向けのA/Bテストのトリアージに関するガイドに記載されている実践的なトリアージとも相性が良いです。変更の候補がたくさんある場合、方向性テストを使って、どれが本格的な実験に値するかを判断できます。
そのままリリースする:現行バージョンがすでに負けているとき
ときには、最もエビデンスに基づいた判断は、テストをまったく実行しないことです。サインアップフォームが電話番号を求めているとします。セッション録画では、このフィールドに到達した数人の訪問者が立ち止まり、離脱する様子が見られます。電話番号が必要かどうかを尋ねるサポートメールも受け取っています。このフィールドは何のためにも必要ありません。削除すべきかどうかをA/Bテストすべきでしょうか? いいえ。削除することは実験ではなく修正です。現行バージョンには既知の欠陥があり、変更は簡単に元に戻せます。修正をリリースして完了率を見守る方が、時間の使い方として優れています。
同じ論理は古いページにも当てはまります。ランディングページがもはや提供していない機能をまだ説明している場合、古いページと新しいページをテストするのは無意味です。あなたは決して残さないバージョンが、リリースしたいバージョンよりも悪いことを証明するためにトラフィックを使っているのです。それはもうわかっています。正しい行動は、まず現行バージョンをリリースし、ライブになったらそれを最適化するための実験を実行することです。
これは、ほとんどのA/Bテストガイドが触れないトレードオフです。テストが終わるのを待っている間、弱いバージョンを公開し続ける毎週は、機会費用を支払っていることになります。変更のリスクが低く、簡単に元に戻せる場合、今リリースすることの期待値は、後で効果を証明することの価値を上回ることがよくあります。測定をスキップしているのではなく、ランダム化実験を前後比較に置き換えているのです。前後比較は弱い証拠ですが、それでも証拠であり、4週間かけて何の判断も出さないよりはましです。
あなたがすでに実行している前後比較テスト
テストなしで変更をリリースしても、測定は止まりません。あなたは今、前後比較実験を実行しています。それに伴う注意点もすべて含めて。このノイズを減らす最善の方法は、何かを変更する前にベースライン指標を設定し、できればトラフィックが少ない時間帯にリリースし、少なくとも1週間のトレンドを見て、ランダムな月曜日に反応しないようにすることです。指標が望んだ方向に動けば、変更を維持します。逆に動けば、元に戻します。まったく動かなければ、変更は中立的だったことを学びます。これも情報です。
これは、ほとんどの人が無視するモードです。彼らはリリースした後、二度と見ません。そして後で、その変更が役に立ったのか害になったのかわかりません。前後比較は厳密ではありませんが、ほとんどのウェブサイトで行われる「何もしない」よりははるかにましです。方向性テストすらできないほどトラフィックが本当に少ない場合、前後比較がしばしば唯一のツールになります。セッション録画、サポートからのフィードバック、変更後の指標のトレンドからシグナルを得ることはできます。どれもランダム化を必要としません。これは、「トラフィックなしでのA/Bテスト」に関する記事で扱っている領域です。
3つのアプローチの比較
1つの表にまとめた比較は以下のとおりです。
| アプローチ | 最適なケース | 間違えた場合のリスク | 得られるもの | 失うもの |
|---|---|---|---|---|
| 本格的な実験 | 収益、価格設定、またはコアフローに影響する変更。判断に足るトラフィックがある | 低い(統計を守れば)。ノイズに反応するのは統計を無視したときだけ | 自信を持って再現可能な結論 | 時間、トラフィック、そして素早く行動する能力 |
| 方向性テスト | リスクが低く、トラフィックがそこそこあり、数日以内に学習シグナルが必要 | 中程度。たまに負けバリアントをリリースすることがある | もっとやる価値があることへの素早いヒント | 証明と、微妙な効果を検出する能力 |
| テストなしでリリース | 現行バージョンが明らかに悪い、変更が修正である、または簡単に元に戻せる | 低い。特にリリース後のモニタリングをすれば | スピードと勢い | 変更を一つの要因に帰属させる能力 |
この表は3行目の力を過小評価しています。「テストなしでリリース」はコンバージョン最適化の界隈で批判されますが、長いバックログと限られたトラフィックを持つ一人マーケターにとっては、しばしば合理的な選択です。本当の罪は、リリースした後に何が起こるかを見ないことです。
15分で選ぶ方法
フレームワーク全体を暗記するよりも速いプロセスが必要なら、次の4つの質問を使ってください。
第一に、「もし間違えたら、何が壊れるか?」です。答えが収益、信頼、コンプライアンスなら、証拠のハードルを上げてください。答えが「大したことない」なら、下げてください。第二に、「どのくらい待てるか?」です。本格的な実験にどれくらいの時間がかかるか見積もってください。変更を遅らせたくない期間より長いなら、選択肢は方向性テストかリリースに絞られています。第三に、「その答えで何をするのか?」です。結果に基づいて行動を変えないのなら、テストを実行しないでください。テストは意思決定を変えるものであるべきです。第四に、「簡単に元に戻せるか?」です。元に戻せる変更はリリースするコストが安く、元に戻せない、またはロールバックにコストがかかる変更は、より多くの証拠に値します。
次に選択します。リスクが高く待てるなら、本格的な実験を実行。リスクが低くスピードが欲しいなら、方向性テストを実行。現行バージョンが明らかに悪く、変更が修正なら、リリースしてモニタリングしてください。決断を変えるためではなく、「やるべきだ」と感じてテストを実行しているなら、それはおそらく優先順位の問題であり、テストの問題ではありません。「無意味なA/Bテストに時間を無駄にするのをやめる方法」に関する記事が次の読み物としておすすめです。
これを冒頭の質問に当てはめてみましょう。新しい見出しがあり、トラフィックはそこそこです。見出しは元に戻せ、デメリットは小さく、1か月待ちたくありません。この論理では、本格的な実験はスキップすることになります。何らかのシグナルが欲しいなら短い方向性テストを実行するか、見出しをリリースして来月のコンバージョン率を今月と比較するかのどちらかです。どちらも理にかなっています。理にかなっていないのは、完了するほどのトラフィックがない「ちゃんとした」テストに4週間費やし、その結論が出ない結果を失敗と呼ぶことです。
注意すべき有意性の罠
統計的有意性は、結果がおそらく本物かどうかを教えてくれますが、重要かどうかは教えてくれません。変更が統計的に有意であっても、努力を正当化するには小さすぎることがあります。逆に、方向性テストでは、実際には存在するがトラフィックでは検出できないほど小さいパターンが見えることがあります。低い証拠のハードルを選ぶとき、あなたはより多くの偽陽性と偽陰性の両方を受け入れています。それはトレードオフであり、失敗ではありません。
もう1つ覚えておく価値のある区別は、実務上の有意性と統計的有意性です。変更が統計的に有意であっても、重要にするには小さすぎることがあります。新しいボタンがクリック数をわずかに増加させ、その増加が1件の追加サインアップにつながるまでに数か月かかるほど小さかったとします。その結果は本物ですが、ページを再構築する価値はありません。一方、統計的に有意でない変更でも、パターンが一貫しており、行動を起こすコストがほぼゼロなら、実務上重要であり得ます。3つのアプローチを選ぶとき、気にかけている効果の大きさが、実際に実験で検出できるものかどうかを尋ねてください。検出できないなら、テストかリリースかを選んでいるのではなく、2つの無知の形を選んでいることになります。
このため、この記事の意思決定フレームワークは、間違えるコストに基づいています。偽陽性が安価なら、たとえば、少し悪い見出しをリリースして元に戻すだけで済むなら、低い証拠のハードルを許容できます。偽陰性が重要な改善を逃すことを意味するなら、テストをより長く続けたほうがよいかもしれません。一人マーケターとして、すべてを最適化することはできません。あなたは学習スピードと確信のバランスを選んでいるのです。ノイズに惑わされずに数字を読む方法についてもっと深く知りたい場合は、「A/Bテスト結果を正しく解釈する方法」に関するガイドを参照してください。
実践的な教訓
このフレームワークのポイントは、テストを減らすことではありません。証拠の基準をリスクに合わせることです。本格的な実験は、変更が重要で、待つ忍耐力がある場合に強力なツールです。方向性テストは、トラフィックが許すよりも速く学ぶ必要がある場合に、賢明な中間点です。そして、現行バージョンがすでに負けている場合、テストなしでのリリースは、その後何が起こるかを監視する限り、最も誠実な選択となることがあります。
次に「これをA/Bテストすべきか?」と聞きたくなったら、より良い質問をしてください。「間違えたら、どれだけのコストがかかるか?」と。その答えが、3つのアプローチのどれを使うべきかを教えてくれます。その判断は、どんなテストツールよりも多くの時間とトラフィックを節約してくれるでしょう。
