Perplexityはクエリによって1回答あたり3〜6件の情報源を引用する。ChatGPTのブラウジングモードが表示するのは、多くても5件程度だ。「Generative Engine Optimization(生成エンジン最適化)」という言葉を生み出した研究者たち――プリンストン大学、ジョージア工科大学、Allen AIによる2023年の論文――は、引用可能な統計データと直接的な引用を含むページがAI生成回答での可視性を最大40%高める一方、かつてGoogleのランキングを動かしていたキーワードの詰め込みはほとんど効果がないことを発見した。この3つの数字はGEOの解説記事でよく引用される。しかし4つ目の数字はあまり語られておらず、実はこれこそがページの書き方を根本的に変えるべきものだ――モデルがドキュメントのどの部分から回答を引き出したかを追跡すると、圧倒的に上位3分の1であることが多い。最も上手に書かれた段落でも、最も詳細なセクションでもない。冒頭だ。
「網羅的であること」がもはや強みではなくなった理由
15年間、SEOのアドバイスは「決定版のリソースを書け」という何らかのバリエーションだった。あらゆる角度をカバーし、2,500語に達し、競合より深く掘り下げれば、Googleのランキングシステムはやがて、あなたが最も網羅的な答えを作ったことに気づく――そういうものだった。しかしこの直感は、生成エンジンが情報源を選ぶ仕組みには通用しない。その理由を理解するには、誰かがChatGPTやPerplexityに検索ボックスに入力する代わりに質問をしたとき、裏側で実際に何が起きているかを理解する必要がある。
検索エンジンはドキュメント全体をランク付けする。生成エンジンは推論時にドキュメント全体を読むわけではなく、チャンク単位で検索する。あなたのページは重複するウィンドウに分割され、たいてい300〜500トークン程度の範囲で、それぞれが埋め込みに変換されてユーザーのクエリとの類似度でスコアリングされる。システムは候補となるすべてのページの中から上位のいくつかのチャンクを取り出し、質問と一緒にモデルのコンテキストに詰め込んで、それを合成して答えるよう指示する。あなたの2,500語のガイドはもはや単一のユニットとして競っているのではない。チャンク単位で競っており、ほとんどの検索パイプラインは次の引用元に移る前に、1つの情報源からせいぜい1つか2つのチャンクしか取得しない。
私が追跡していたクエリで実際にどのページが引用されるかに注目し始めたとき、驚いたのはこの部分だ――後のセクションの方がクエリにより正確に答えている場合でも、冒頭のチャンクが不釣り合いなほど頻繁に勝つ。ある程度は本物の関連性による――優れたライターはそもそも答えを冒頭近くに置く。しかしその多くは構造的なものだ。タイトル、H1、メタディスクリプションは多くの検索システムで余分な重みを付けてインデックスされ、その重みは直下の段落にも波及する。実際の主張を6段落分の前置きの下に埋もれさせているページは、自分ではコントロールできないチャンクの境界に最良の素材を渡してしまっているのだ。
実際の比較ではこう見える
| 要因 | 従来のSEOでの重み | GEOでの重み |
|---|---|---|
| 総単語数 | 長年ランキングと相関していた | 最初のチャンクを超えるとほぼ無関係 |
| キーワード密度 | 歴史的には中程度のシグナル | ほぼゼロ――埋め込みは文字列の一致ではなく意味を照合する |
| ページ内での回答の位置 | 軽微なUX要因 | 支配的――どのチャンクが取得されるかを決定する |
| 引用可能な統計/直接引用 | 被リンクにはあれば良い程度 | プリンストン/GT大学の研究によれば最大+40%の可視性 |
| 被リンク数 | 主要なランキングシグナル | 良くても間接的――クロールの優先順位には依然として関係するが、検索スコアリングには関係しない |
多くの人が誤解している部分
ビルダーが「GEOをやろう」とするときによく見かける間違いは、それを新しい語彙を使ったキーワード問題として扱うことだ――人々がChatGPTに入力するフレーズを探し出し、見出しに組み込もうとする。それは無意味ではないが、レバレッジがほぼ完全にドキュメント側にあるときに、マッチのクエリ側を最適化していることになる。実際に引用数に現れる動きは、ニュアンスや注意点、自分が答える資格がある理由のいきさつにたどり着く前に、最初の150〜200語で平易な断定文で質問に答えることだ。
私は自社のヘルプセンターのページの1つを、答えをファーストビューの中に移動させるためだけに書き直した――内容も語数もそのままで、順番を変えただけだ。すると、3か月間一度も表示されたことのなかったクエリでPerplexityの回答に表示され始めた。他には何も変えていない。これは小さな1つのデータポイントであって研究ではないが、イントロを書くのをやめたくなるような類のものだ。
知っておく価値のある二次的な効果はこうだ――検索単位はページではなくチャンクなので、長いページが深さのために不利になることはない。ただし、その深さが後で人がクリックする理由であったとしても、引用そのものではその深さに対する評価は得られない。つまり、古い習慣であるSEO向けの前置き(「この完全ガイドでは、〜について解説します」)を冒頭に詰め込むことは、実際に重要な1つの枠を犠牲にしている。一方で下の方にある本当の内容は、クリック率や滞在時間のために無償で働き続けているが、モデルのコンテキストウィンドウにはまったく入らないのだ。
実際に何を変えるべきか
私が観察してきたページで実際に効果があった順に3つ挙げる。暗黙の質問への直接的な答えを、3段落目ではなく最初の段落に置くこと。同じ段落に具体的な数字や実名の情報源があれば使うこと――40%という数字は偶然ではなく、モデルは何を引用するか選ぶ際に一般的な主張よりも具体的な主張を重視しているように見える。そして各見出しを、それだけが取得される唯一の文になるかもしれないという前提で構成すること――AI回答トラフィックのかなりの割合において、実際にそうなるからだ。
これらはどれも、最初から最後まで読む価値のあるものを書くことの代わりにはならない。ただ、冒頭の200語はもはや前置きのための不動産ではなく、あなたを引用する価値があるかどうかを判断するたった1つのモデルという読者へのすべてのピッチだということだ。



