AI 文章の電子透かし: OpenAI の textGrain、Claude の SynthID 方式の透かし、そして誰が確かめられるのか
文章の透かしの検出結果から何が言えるのか、どれだけの編集に耐えるのか、そして現時点で公開されている誤り率がなぜすべて鍵を持つベンダー自身の測定なのか。そのうえで、採点する人、書く人、これらのモデルの上で開発する人にとって何を意味するのかを考えます。
10月5日、OpenAI は、EU 域内の ChatGPT と Codex の文章に「今後数週間で」目に見えない電子透かしを入れること、そして世界中の API 利用者が同じ透かしを今日から有効にできることを発表しました。仕組みの名前は textGrain です。文字は追加せず、隠し記号も埋め込みません。モデルがどの単語を選ぶかをわずかに変え、そのパターンを後から秘密鍵で見分けられるようにします。
Anthropic は 2 か月早く動いていました。8月に、対応する Claude モデルがすべての製品、すべての国で文章に透かしを入れていると発表しています。方式は Google DeepMind が 2024 年に Nature で発表した手法の一バージョンです。両社とも EU AI 法 第 50 条を受けての対応で、検出の扱いも同じでした。検出器は公開されていません。研究者や一部の組織は申請できます。1 本の文書を確かめたい教師、編集者、書き手には入り口がありません。
筆者は透かしを測定器として読み、どの測定器にも向ける問いを向けます。誰がそれを持っているのか、誰が誤り率を公表したのか、誰が同じテストを再現できるのか。textGrain と Claude について、今のところの答えはそれぞれ、ベンダー、ベンダー(あるいは誰も公表していない)、そして独立した結果はまだ誰も公表していない、です。新しい不満ではありません。9月の論文 Watermarks Without Verification は、「透かしそのものではなく」この検証不能性こそが「実質的なガバナンスの失敗」だと論じています。その 1 か月後に OpenAI が数値を公表したことで、この問いをより正確に立てられるようになりました。
OpenAI は textGrain ウォーターマークで何を発表したのか?
OpenAI 自身の発表によれば、内容は 3 つです。
Starting today, API customers globally will be able to opt in to text
watermarking for select models. Text watermarking will remain off by
default in the API. Over the coming weeks, we will add an invisible
watermark to eligible ChatGPT and Codex text output in the European Union.3 つ目は検出器です。「アクセスは当初、承認された研究者と専門組織に限定されます」。ヘルプセンターは最初の研究パートナーとして、Cornell の John Thickstun、ETH Zurich と INSAIT の Martin Vechev、そして Kempelen Institute of Intelligent Technologies を挙げています。
API 利用者にとって、この切り替えはリクエストパラメーターではなくダッシュボードの設定です。Organization settings、Data controls、Text provenance と進むか、プロジェクトの設定で同じ項目を開き、モデルごとに選びます。API リファレンスにも changelog にも、リクエスト単位の設定は見つかりませんでした。ChatGPT の対象は「EU のみ、全プラン」で、誰が EU にいるのかをどう判定するのかを OpenAI は明らかにしていません。
OpenAI は、実際に展開した透かしの検出率も公表しました。Anthropic は自社の透かしについてこれをしていません。
| OpenAI の評価 | 検出率 |
|---|---|
| 200 トークンの文章、心理学系の質問、偽陽性率 1% | 約 80% |
| 400 トークンの文章、同条件 | 約 95% |
| 数学の回答 | 「大幅に低い」、数値は示されていない |
| 400 トークンの文章、未編集(別のテスト) | 約 92% |
| 同上、単語の 10% を同義語に置き換えた後 | 66% |
| 同上、単語の 25% を同義語に置き換えた後 | 17% |
| EU 公用語 24 言語、偽陽性率 1% | 42.2%(ルーマニア語)〜 69.0%(スペイン語) |
言語の行はヘルプセンターの数値で、OpenAI はその後、60% を下回った言語で透かしの強度を上げたとしています。テストの長さは書かれていないので、この行は英語の行と直接は比べられません。
GPT-6 "Astra" の透かしあり・なしを比べたベンチマークの結果は、上下どちらにも振れています(GPQA Diamond は 94.44% 対 93.94%、Terminal-Bench 4.0 は 53.90% 対 56.06%)。OpenAI の解釈は「意味のある性能差は見られない」です。UPenn と Yale の研究者と共同で書かれた技術レポートには数式があり、評価の数値はありません。OpenAI はこのレポートを「今後数週間で」更新するとし、オープンソースでの公開も予定していますが、日付は示していません。
Claude は文章に透かしを入れているのか?
入れています。しかも範囲はより広いです。8月14日の Anthropic の解説記事とサポートページによれば、透かしは API、Claude アプリ、Claude Code、Cowork、Claude Tag で対応モデルが出力する文章に入り、AWS、Google Cloud、Microsoft Foundry 経由でも同じで、「Claude が提供されているすべての場所、世界中で」適用されます。対応はまだ完了していません。サポートページのモデル表には 8月より前にリリースされたモデルも含まれ、Bedrock への展開は 10月12日までに終わる予定です。どちらのページにも、透かしをオフにする方法は書かれていません。
Anthropic が全世界に適用した理由は 1 行です。
We're applying watermarking globally at launch because we don't yet have
a durable way to scope it by region.方式は「Google DeepMind が公開した SynthID-Text のアプローチの一バージョン」です。Anthropic は、OpenAI が答えていない実務的な質問に答えています。自分の文章を校正させた場合、「透かしが付く余地はほとんど(あるとしても)残りません」。Claude が作った翻訳には透かしが入ります。「この場合、すべての単語を Claude が選んでいるから」です。編集については、「軽い編集ではおそらく透かしは完全には消えません。すべての単語を置き換える完全な書き直しなら消えます」。検出は「プライベートプレビュー中の検出 API」で、規制当局、法執行機関、メディア、ファクトチェッカー、独立研究者、教育機関、EU の市民社会団体、そして同法のもとで独自の義務を負う企業が対象です。
Anthropic は検出率を一切公表していません。長さごとの曲線も、偽陽性率も、編集テストもありません。
反発が大きかったのは 8月の発表の方です。TechCrunch は、Claude のユーザーが、自分たちは「指示、文脈、判断」を提供しており、Claude は「道具」にすぎないと反発したことを伝えています。今週読んだスレッドでは、OpenAI への反応として EU 限定にとどまったことへの安堵が繰り返し見られ、回避のために Claude へ移ろうという書き込みも少なくとも 1 件ありました。それでは解決になりません。
どの AI 企業が、どこで文章に透かしを入れているのか?
10月6日時点、各社のページがある場合はそれに基づいています。
| 提供元 | 文章の透かし | 範囲 | 検出へのアクセス |
|---|---|---|---|
| OpenAI | textGrain(独自方式) | EU の ChatGPT と Codex で展開中。API は世界中でオプトイン | 申請制。承認された研究者と組織 |
| Anthropic | SynthID-Text の一バージョン | 対応モデル、すべての Claude サービスとクラウドパートナー、全世界 | 対象組織向けのプライベートプレビュー API |
| SynthID-Text | Gemini アプリと Web。Google の社員が 8月、当初は入らないと答えた後で、Gemini API の文章にも透かしが入ると認めた | SynthID Detector ポータル。2025 年に発表され、ジャーナリストと研究者向けの順番待ちリストあり | |
| Mistral | 明記なし | Vibe Code の法務ページで「2026年12月2日までに」透かしと検出を約束 | 明記なし |
| Meta、Microsoft | 展開に関する声明は見つからず | 両社とも EU 行動規範の提供者セクションに署名 | 明記なし |
| 中国の提供者 | 2025年9月1日から表示ラベルとファイルメタデータが義務。透かしは「奨励」にとどまる | 中国 | 明記なし |
OpenAI は画像と音声にはすでに Google の SynthID を使っていますが、文章には独自方式を作りました。理由は「透かしの検出しやすさと、同じプロンプトから生成される応答の多様性とのバランスを、SynthID や TextSeal より細かく制御するため」です。TextSeal は Meta のオープンソースの文章透かしです。Meta の製品で動いているという発表は見つかりませんでした。
EU AI 法 第 50 条は生成された文章に何を求めているのか?
拘束力を持つのは第 50 条 2 項です。文章、画像、音声、動画を生成するシステムの提供者は、出力が「機械可読な形式でマークされ、人工的に生成または操作されたものとして検出可能」であるようにしなければならず、その手段は「技術的に実現可能な範囲で、効果的、相互運用可能、堅牢かつ信頼できる」ものである必要があります。透かしを指定しているわけではありません。適用は 2026年8月2日からで、違反すると最大 1,500 万ユーロまたは全世界の年間売上高の 3% のうち高い方の制裁金が科される可能性があります(小規模な企業には低い方が適用されます)。
Digital Omnibus、つまり Regulation (EU) 2026/1744 は、8月2日より前に市場に出ていたシステムに 2026年12月2日までの猶予を与えています。OpenAI の「今後数週間で」、Mistral の 12月2日という日付、そして Anthropic が新モデルにはリリース時から透かしを入れつつ旧モデルへの対応を続けていることと符合します。Omnibus が 6 か月の猶予期間を 3 か月に短縮したと報じた記事もありますが、公表された条文では 4 か月です。
細部は、拘束力の弱い 2 つの文書にあります。6月10日に最終版となった行動規範(Code of Practice)は任意のもので、Omnibus はこうした規範が適合性の推定を与えないと明記しています。その提供者セクションには Anthropic、Google、Meta、Microsoft、Mistral、OpenAI などが署名しています。規範は通常、署名付きメタデータと不可視の透かしの 2 層を求めますが、自由形式の文章はメタデータを保持できないものとして扱うので、文章については透かしだけで足ります。200 トークン未満の文章への透かしは求めていません。
検出について、規範のデフォルトは手厚いものです。無料で、規制当局、メディア、ファクトチェッカー、独立研究者、教育・研究機関、市民社会に無制限のアクセスを提供する、というものです。文章は例外です。
Signatories may restrict access to detection mechanisms associated to
watermarking techniques for free-form text to the extent that they have a
lower level of reliability and robustness...その場合、アクセスは検証済みの専門家ユーザーに限定でき、規範はどんな制限も「期間を限ったものとする」としていますが、期日は示していません。OpenAI は限定的なアクセスを説明する際にこの規範を引いています。Anthropic の対象グループのリストは、規範のデフォルトのリストにかなり近いものです。
7月20日に出た欧州委員会の第 50 条ガイドラインも拘束力はありませんが、ソースコードを義務の対象外としています。SQL、設定ファイル、Infrastructure as Code、コードに属するコメント、エージェント間の通信のように機械同士だけでやり取りされるメッセージも同様です。また、マークが不要な軽微な編集として「AI による文章の翻訳」を挙げています。OpenAI のヘルプページはコードの除外を行動規範によるものとしていますが、実際の出どころはガイドラインです。Anthropic は、ガイドライン上は省略できるにもかかわらず、Claude の翻訳に透かしを入れています。
LLM の文章透かしはどう機能するのか?
言語モデルは、確率分布からサンプリングしながら 1 トークンずつ文章を書きます。透かしは秘密鍵を使ってそのサンプリングに手を加えます。手を加えるのはそこだけです。
初期の設計で最もよく知られているのは、メリーランド大学の Kirchenbauer らによるグリーンリスト(ICML 2023)です。直前のトークンを鍵とともにハッシュし、その結果で語彙を「グリーン」の一部と「レッド」の残りに分け、グリーンのトークンに小さなボーナスを与えます。人間の文章がグリーンに当たる頻度は、ほぼ偶然から予想されるとおりです。透かし入りの文章はそれより多く当たり、その個数に対する z 検定で両者を見分けます。50/50 の分割と中程度のボーナスで、論文は 200 トークンの生成文の 98.4% を、偽陽性率 10 万分の 3 で検出しました。ただし、このボーナスはモデルの選択を実際にずらします。
当時 OpenAI にいた Scott Aaronson は 2022 年に、平均的にはモデルの選択をずらさない方式を説明しています。鍵付きの擬似乱数関数で各トークンを選びつつ、結果がモデルの確率と一致するようにするやり方です。難点は、textGrain のレポートの言葉では「文脈と鍵が固定されていれば、常に同じトークンを選ぶ」ことです。文脈全体、鍵、設定が同じなら、答えも同じになります。
Google DeepMind の SynthID-Text(Nature、2024年10月)はトーナメントサンプリングを使います。多数の候補トークンを引き、ラウンドごとに異なる鍵付き関数で判定する勝ち抜き戦にかけます。約 2,000 万件の Gemini の応答を使った実運用テストでは、透かしあり・なしの回答に対するユーザー評価の差は 0.01% の桁にとどまり、統計的に有意な差ではありませんでした。別のベンチマークでは、Gemma 7B での生成時間の増加は 0.57% でした。Anthropic が手を加えて採用したのはこの方式です。
textGrain は、毎回同じ答えになる問題を避けながら、Aaronson の方式の統計的性質を保っています。「エントロピー予算」、つまり次トークンのサンプリングのランダム性のうち透かしが平均してどれだけ使うかの理想的な上限を設け、最適輸送のステップで鍵付きの値とモデルの選択を結びつけます。鍵について平均すると、次トークンの分布はどれも変わりません。検出器が「必要とするのは生成された文章と秘密鍵だけ」です。
これらすべてに共通する限界があります。透かしは、モデルが別の選び方もできた選択の中にしか存在しません。次のトークンがほぼ確定しているときは、傾ける余地がありません。OpenAI は、数学の検出率が「大幅に低い」のは「語の選択の自由度が小さい」からだとしています。Anthropic は、「正確な出力が求められる」場合は「透かしは適用されない」とし、コードは「一般に透かしが少なく」、入るのは主にコメントだと述べています。この仕組みから、筆者の推論が 2 つ導かれます。どちらも公には検証されていません。まず、信号の量は形式だけでは決まらないはずです。散文の段落を値に持つ JSON フィールドには、その段落と同じだけの余地があります。そして、Karpathy が読みやすいモデル出力のために勧めた ASD-STE100 規格のように、語の選択を絞るために作られた制限言語で書かれた文章は、信号が弱くなるはずです。
コードについて見つけた唯一の独立した数値は、9月の論文にあります。著者らは Google のオープンソースの SynthID 実装を 2 つのオープンウェイトモデルで動かしました。散文では、透かしが品質に与える影響は乱数シードを変えた場合を超えませんでした。コードでは、正しさが一方のモデルで 3 ポイント下がり、もう一方では測れないほど小さな差で、「一方で検出はほぼ偶然レベルのまま」でした。これは公開実装のテストであって Claude や textGrain のテストではありません。それでも、コード中の透かしの検出について、どちらのベンダーが公表した情報よりも多くを語っています。
文章の透かしはどう検出され、誰が検出器を使えるのか?
検出器は鍵付きの統計検定です。文章について鍵付きの値を計算し直してスコアを付け(textGrain は異なるコンテキストウィンドウごとに最初の出現だけをスコアに入れるので、繰り返されるフレーズは二重に数えられません)、鍵と無関係な文章でそのスコアが出る確率はどれくらいかを問います。理論上、偽陽性率はベンチマークから推定するのではなく事前に設定されます。これは文体ベースの AI 検出器との本当の違いです。ただし実際には、展開した鍵には「経験的な較正チェック」が必要だと textGrain のレポートは付け加えています。
証拠は長さとエントロピーに応じて増えます。Kirchenbauer のグリーンリストは、ベースモデルで 200 トークン時に 98% に達しました。Kuditipudi ら(TMLR 2024)は、ベースモデルではわずか 35 トークンから検出できましたが、短い回答を返す指示チューニング済みモデルでは、検出できた応答は約 4 分の 1 にとどまりました。OpenAI は 200 トークンで約 80% と報告しています。短いチャットの回答は、どの方式にとっても難しいケースです。
検定を計算できるのは鍵の持ち主だけで、鍵はベンダーごとに別です。Anthropic は、自社の検出器では文章が別の AI から来たかどうかを判別できないと述べています。「その AI が透かしを使っていても、鍵が異なる」からです。つまり OpenAI の表の誤り率は、ベンダーが自分の測定器を自分で採点したものです。除去ツールは本物の検出器で検証できません。そして、透かしがユーザーを特定しないという約束も、確かめられるのは鍵の持ち主だけです。
アクセスを限定することには実際の論拠があり、OpenAI はそれを示しています。「透かしの見逃しと偽陽性のリスクを考え、公開時点では一般には提供しません」。公開された検出器はオラクルにもなります。攻撃者は編集がぎりぎり通るまで問い合わせを繰り返せますし、偽造がうまくいったかの確認にも使えます。後述する窃取(stealing)攻撃はモデルの出力さえあれば成り立つので、アクセス制限では防げません。ただ、攻撃者から結果を確かめる手段を奪うことはできます。とはいえ、閉じた検出器だけが唯一の設計というわけではありません。Fairoze らは、検出アルゴリズムが「秘密情報を含まない」、公開で検出可能な透かしを示しています。カリフォルニア大学の特許出願は、公開鍵で検証できる署名を文章に埋め込む方式を対象にしています。検出を非公開にするのは選択であり、部分的には擁護できる選択です。
承認された機関の外にいる人にとっては、「ChatGPT の透かし」をチェックすると称するサイトはどれも別の何か、たいていは文体分類器を動かしていることになります。その実績は芳しくありません。2023年1月に公開された OpenAI 自身の分類器は、AI の文章の 26% しか検出できず、人間の文章の 9% を AI と判定し、同年 7月20日に「精度の低さ」を理由に取り下げられました。Patterns 誌の研究は、英語を母語としない人が書いた TOEFL のエッセイに 7 つの検出器をかけ、偽陽性率が平均 61% だったと報告しています。透かしはこうした文体バイアスを避けられますが、それは使うことを許された人にとってだけです。
AI 文章の透かしはどう除去され、どう偽造されるのか?
OpenAI は、以前の透かしの公開を見送った 2024年8月に、その手段を挙げていました。「翻訳システム、別の生成モデルでの言い換え、あるいは単語ごとに特殊文字を挿入するようモデルに頼み、後でその文字を削除すること。悪意ある者にとって回避は造作もない」。textGrain について、2026 年の資料は最初の 2 つが検出を弱めることを認めています。3 つ目は公には検証されていません。
最もよく研究されているのは言い換えです。言い換え専用モデルの DIPPER は、グリーンリストの検出率を 100% から 57.2% に下げました(NeurIPS 2023)。言い換えを繰り返すと、5 回で 20% 未満まで下がり、人間の評価者は出力をなお高く評価しました。OpenAI の表の 25% 同義語置換の行も同じ効果ですが、17% はゼロではありません。長さは逆向きに働きます。Kirchenbauer のグループは、人間が大幅に言い換えた文章でも、平均約 800 トークンあれば偽陽性率 10 万分の 1 で検出できることを示しました。長いエッセイは短い回答より多くを漏らします。Zhang ら(ICML 2024、"Watermarks in the Sand")は、攻撃者が品質を判定でき、十分に繰り返せば同程度の品質のどんな文章にも到達できるような小さな編集を加えられるなら、強い透かしは不可能であることを証明しました。彼らの汎用的な攻撃は、公開済みの 3 つの方式をわずかな品質低下で除去しています。
2 つ目の手段は翻訳です。答えを別の言語で出させ、透かしを入れないツールで訳し戻します。ACL 2024 で検証された方式では、これで検出率はほぼ偶然レベルまで下がりました。どれだけ残るかは設計次第で、textGrain や Claude の透かしについて翻訳テストを公表した人はいません。OpenAI のドキュメントも Google の SynthID のドキュメントも、翻訳を弱点として挙げています。翻訳に使うツールは透かしなしでなければならないので、Claude はその役に使えません。
挿入して削除する手口では、モデルに単語ごとに絵文字や記号を入れさせ、後でそれを削除します。鍵付きの値は記号を含む文脈で計算されているので、記号を消すとパターンが合わなくなります。Kirchenbauer の論文は、この手口を Riley Goodside のものとしています。
最もよく話題になるのは、透かしのないオープンウェイトモデルでの書き直しです。SynthID の論文自体がこの穴を挙げており、「分散的に展開される」オープンモデルに透かしを強制するのは難しいとしています。最初からオープンモデルで書かれた文章には、そもそも透かしがありません。
危険なのは偽造の方向です。人が自分で書いた文章を陽性にすることを意味するからです。ETH Zurich の Jovanović、Staab、Vechev は(ICML 2024)、50 ドル未満の API クエリで、攻撃者が以前のいくつかの方式について偽造と除去の両方ができるだけの情報を学習でき、成功率は 80% を超えると見積もりました。同じラボはオープンな SynthID-Text 実装も調べています。偽造ははるかに難しく約 4%、9 万回のクエリでも約 15% でした。言い換えでは、依然として 90% 以上の確率で透かしを消せました。textGrain をこの方法で公にテストした人はいません。Vechev は現在、OpenAI の評価パートナーの 1 人です。
Anthropic の発表から数週間のうちに除去の市場が生まれ、「Claude watermark remover」を掲げるサイトが現れました。ベンダーの検出器にアクセスできない以上、どのサイトも自分のツールが効くことを示せません。2025 年から残っている「不可視文字クリーナー」は、これにはまったく効きません。当時、OpenAI の o3 と o4-mini の出力に狭いノーブレークスペースが見つかり、透かしだと言われました。それを報告したスタートアップは、それが「大規模な強化学習の癖」だという OpenAI の回答を伝えています。今の透かしには取り除く文字がありません。OpenAI の透かしは「隠し文字、不可視のスペース、珍しい句読点を追加しない」もので、Anthropic も「文章には何も追加されず、隠し文字もない」と述べています。
AI 文章の透かしは何を証明でき、何を証明できないのか?
OpenAI の発表で最も役に立つのは、透かしが教えてくれないことのリストです。人間の貢献度は測れず、所有権や責任は確定できず、正確さも確かめられません。透かしは「人物、組織、アカウント、プロンプト、会話を文章と結びつけない」。そして、こう書いています。
The absence of a detected watermark does not prove human authorship.Anthropic は、自社の検出器が「『Claude が書いた』と『Claude が大幅に編集した』を区別できない」と付け加えています。陽性の結果は、モデルが多くの単語を選んだことの統計的な証拠です。偽陽性率がゼロでないことと偽造の研究を踏まえると、それすら証明には届きません。誰がアイデアを出したのか、モデルの使用が許されていたのかについては何も語りません。
さらに、これに量を掛けて考える必要があります。OpenAI は 2024 年、自社に不利な形でこの点を指摘しています。「大量の文章に適用すれば、偽陽性の総数は大きくなる」。公平性の懸念も挙げていました。透かしは「英語を母語としない人にとって有用な執筆ツールである AI の利用に、汚名を着せかねない」。ガイドラインは文法の修正や軽い推敲を免除していますが、流暢にするために段落を書き直すモデルは単語を選んでおり、透かしにはその理由がわかりません。
法律は「相互運用可能」で「堅牢」なマークを求めています。各ベンダーは自分の鍵と自分の検出器を使い、OpenAI 自身のテストでは、単語の 4 分の 1 を変えると検出率は 17% です。それが「技術的に実現可能な範囲で」を満たすかは規制当局が判断する問題で、規範にある文章の例外を見る限り、当局は当面この差をすでに受け入れているようです。
LLM の文章透かしについて、誰が特許を出願しているのか?
確認できた出願は、ほとんどが上で触れたサンプリング手法に関するものです。DeepMind の US20240320529A1 は優先日が 2023年3月で、現在は GDM Holding に譲渡されています。各トークンへの多段階の鍵付き透かしを対象とし、従属請求項には SynthID-Text で使われるトーナメントが記載されています。グリーンリストを考案したメリーランド大学のグループは US20250238634A1(優先日 2024年1月)を出願しており、その第 1 請求項は範囲が広く、単語に割り当てた擬似乱数スコアでモデルのサンプリングを変更することを対象にしています。UC San Diego に譲渡された出願 US20260113199A1(検索結果の一覧では Northeastern University と表示)は、最初のトークンを鍵ペアで署名し、その署名を後続のトークンに埋め込むので、公開鍵で検証できます。Baidu の CN116340909A は異色で、スクリーンショットを追跡するために、各文字の視覚的な属性にユーザー情報を符号化します。これはまさに、OpenAI と Anthropic が自社の透かしではしないと言っていることです。
OpenAI や Anthropic による、統計的な文章透かしの公開済み特許は見つかりませんでした。ただ、それはほとんど何も証明しません。米国の出願は通常、優先日から約 18 か月後に公開されるため、最近の出願はまだ見えていない可能性があります。
教師、書き手、開発者は AI 文章の透かしにどう対処すべきか?
他人の文章を採点・編集する立場なら、今のところ自分で文章をチェックする方法はありません。所属機関が OpenAI と Anthropic にそれぞれ別々に申請することはでき、各検出器が見えるのは自社の透かしだけです。ChatGPT や Claude の透かしをチェックできると称するサービスは、ほぼ確実に文体から推測しているだけです。陰性の結果は何も証明せず、陽性の結果はモデルが関与した証拠であって、不正の証拠ではありません。
モデルを使って書くなら、Claude の出力はどこにいても透かしが入っていると考えてください。EU にいるなら、ChatGPT の出力も展開が届いた時点から透かしが入ります。自分の文章を校正させるだけなら、透かしが入る余地はほとんどありません。段落全体の書き直しをモデルに頼めば、たっぷり入ります。出版社やクライアントが AI 支援の作品と AI が書いた作品を区別するなら、下書きを残しておいてください。透かしにはその区別ができません。
API の上で開発するなら、デフォルトが違います。OpenAI の透かしは、組織内の誰かがプロジェクトごと・モデルごとに有効にしない限りオフです。Claude の透かしはオンで、オプトアウトの方法は文書化されていません。欧州委員会のガイドラインの読み方では、コード、設定、機械間のメッセージは義務の対象外ですが、これは法的な線引きであって、それらに透かしが入らないという技術的な保証ではありません。製品が生成する顧客向けの散文は、おそらく対象に入ります。開発者への Anthropic の助言は率直です。「自社の製品やサービスに第 50 条が何を求めるかは、独自に評価すべきです」。公共の利益に関わる事柄について AI の文章を公開するなら、第 50 条 4 項により開示義務が加わります。ただし、文章が人間によるレビューや編集上の管理を経ており、誰かが編集責任を負っている場合は除きます。
次に注目すべき点は、textGrain の公開によって外部の人が OpenAI の曲線を自分のモデルで再現できるようになるか、Anthropic が誤り率を公表するか、そして文章の検出器に対する規範の制限がいずれ解除されるか、です。
筆者の見立てでは、ここには 2 つの別々の失敗があり、決定によって直せるのはそのうち 1 つだけです。信号はもろい。これは手法に由来し、完全にはなくならないかもしれません。測定器は閉じている。これは選択であり、公開時点では擁護でき、規範にも認められていて、覆すことができます。覆されるまでは、文章の透かしはベンダーが測り、求めに応じて報告する測定値です。規制当局にとっては本物の証拠であり、承認を得られない人にとってはほとんど意味を持ちません。