溜まったメールのどれから返すか。候補が多いと、選ぶだけでも時間がかかる。そこで試したのが、文章を書かずに選ぶことだけをするAI「Jev」だ。今回はGODMODEの記事41本を使い、それぞれの記事から次に読む1本を選んでもらった。さらに、文章に直すべきところがあるかも聞いてみた。41本ぶんの結果が出そろうまで7秒。今回の実験全体にかかった費用は、合わせてたった9セントだった。
まず記事41本を渡してみた
Jevは登録すると5ドル分を無料で試せる。記事1本と質問をまとめて渡しても、1回の費用は0.1セントに届かない。安いので、思いつく質問は全部聞いてみることにした。
各記事の題名、説明文、見出し、本文を1本分ずつ入力した。リンク先の候補として、ほかの40本の題名と説明文も添えている。Jevには候補から次に読む1本を選んでもらい、元の記事についても、書き直す必要があるか、AIが引用しやすい文章かなどを評価してもらった。41本ぶんの結果は7秒でそろっている。
続いて、記事どうしで内容が重なっていないかを調べた。41本から2本ずつ取り出した全820組を比べても、同じ問いに答えると判定された組はなかった。いちばん近い組でも、確率は0.12だった。全820組の比較は56秒で終わり、費用は3セントである。書き直しが必要かも聞いたところ、40本はそのまま、1本は書き直しという結果になった。
答えられなかった質問もある。「この記事を直すと検索流入に効くか」を3段階で聞くと、41本のほぼ全部で2段目と3段目に割れ、確信の度合いは平均0.19にとどまった。渡した材料の中に、検索で見つかる見込みを判断する手がかりがなかったからだ。Jevは渡したものの中からしか選ばない。何を渡すかで、返ってくる答えの確かさが決まる。
次に読んでほしい記事が見つかった
Sunoの実演記事の次に、何を読んでもらうか。Jevが選んだのは、Sunoとワーナーの提携記事だった。添えられた確率は1.0である。Figureの家事ロボットを紹介する記事からは、Hugging Faceのアヒル型ロボットへ。同じ製品の続報だけでなく、別のロボットの記事まで探してくる。
選んだリンク先に0.8以上の確率が付いたのは、41本中10本だった。編集部が見ても、どれも納得できる組み合わせだ。リンク先を選ばなかった記事もある。ウェブ開発ツールhtmxの記事では、「リンク先はない」という答えに0.81の確率が付いた。ほかの40本から選ぶように頼んでも、つなぐ相手がなければ「ない」と言い切る。選ばせると何かしら選んでしまうAIが多いなかで、選ばないという答えを自信つきで返してくる。
一方、選んだ候補の確率が0.5未満だったのは22本で、こちらはAIエージェントを扱う記事が多かった。Grok Botの記事では、メタのMuseが0.45、グーグルのWebMCPが0.39と並ぶ。どちらもAIエージェントが題材で、数値は近い。こうした候補は人が読み比べ、次に読んでほしいほうを選べばよさそうだ。
段落だけ読んで意味が通るか
次に読む記事の候補はそろった。今度は、AIが検索の回答に引用しやすい文章になっているかを確かめた。リンクシェア・ジャパンの調査によると、グーグルのAI Overviewsは記事の冒頭だけでなく、本文のさまざまな箇所を引用するという。そこでJevには、記事全体と段落ごとの両方を評価してもらった。
記事全体の点数は、見出しのある28本が2点満点で平均1.84点、見出しのない13本が0.96点だった。見出しそのものにも直す余地がある。88個のうち、読者が検索しそうな問いの形になっていたのは23個にとどまった。
ところが、段落ごとに「前後を読まなくても意味が通るか」と聞くと、見出しのない記事のほうが高く評価された。意味が通るとされた割合は、見出しのある記事で43%、ない記事で62%である。つまりGODMODEには2種類の記事がある。見出しはあるが段落だけ抜き出すと意味が通りにくい古い記事と、見出しはないが段落だけでも意味が通る新しい記事だ。自分のサイトの正体が、1分で見えた。
段落の順番を変えると答えも変わる
段落ごとの結果には、もう一つ大きな発見があった。最初は1本の記事の28段落をまとめて入力したのだが、後半の段落には、内容が違っても似た評価ばかりが返ってくる。
試しに段落の順番を逆にしてみた。すると、もともと冒頭にあった段落の評価が変わり、「それだけで問いへの答えになる」とされる確率は0.15から0.75へ跳ね上がった。評価が変わったのは、冒頭の段落だけではない。もともと20番目にあった段落も、「それだけで問いへの答えになる」とされる確率が0.37から0.82へ上がった。一方、結びの意見の段落が「事実を含む」とされる確率は、0.52から0.11へ下がった。文章は一字も変えていない。変えたのは、渡す順番だけだ。リンクシェア・ジャパンの調査によると、AI検索は本文のあちこちから段落を拾う。Jevと同じように置き場所で評価が変わるなら、書き手は文章だけでなく配置も工夫したくなる。
そこで483段落を一つずつ、記事の題名だけを添えて入力し直した。今度の結果は、編集部が読んだ印象と合っていた。意見だけの段落には「事実を含まない」、動画の出典が書かれた段落には「出どころがある」という評価が付いた。やり直しは20秒で終わり、費用は2セントだった。Jevの公式資料にも、関係のない材料を多く含めると精度が落ちると書かれている。
選ぶ仕事はもう任せられる
書くAIには、もう慣れた。Jevは書かない。渡したものを読んで選び、どれくらい確かかも数字で返してくる。今回はたまたま自分たちの記事だったが、1,000通のメールでも、履歴書の山でもいい。「時間がないから」と読み飛ばしてきたものも、Jevに選ばせればいい。Jevを作ったTypeSafeの開発者は、同じ仕組みでゲーム「Doom」を毎秒10回の判断で動かした。選ぶだけでゲームまで動いてしまう。
さて、次はなにをやらせようか。