Anthropicは2026年8月、将来のClaudeモデルが生成する文章にテキスト透かしを導入すると発表しました。読者には見えず、追加文字も追加トークンもない一方、専用の鍵を使えば「Claudeが関与した可能性」を確率的に調べられます。
ここで重要なのは、透かしが著者を断定する証明書ではないことです。AI利用を管理する組織ほど、検出結果を単独の判決にせず、複数の証拠を組み合わせる設計が必要です。
文章そのものではなく「単語選択の揺らぎ」に印を残す
言語モデルは、文脈に合う次の単語候補から一つを選びながら文章を作ります。意味や正確さがほぼ同じ候補が複数ある場面では、どれを選ぶかに一定の余地があります。
Anthropicが採用するのは、Google DeepMindが公表したSynthID-Text系の方式です。通常の乱数の代わりに、鍵と直前の単語から決まる規則を使って候補を選びます。文章を読む人には違いが分かりませんが、鍵を持つ検出側は、単語列がその規則とどの程度一致するかを評価できます。
- 隠し文字や識別子を本文へ埋め込みません
- 追加トークンがなく、料金は増えません
- 利用者、組織、会話を特定する情報は含みません
- 意味や正確さを犠牲にしてまで透かしを付けません
いわば、完成した文章にスタンプを押すのではなく、同じ目的地へ向かう複数の自然な道から、鍵に沿って一つを選ぶ仕組みです。
検出できないことを先に理解する
Anthropicの説明では、検出で分かるのは「Claudeが一部を書いた可能性」です。人間が書いたことの証明や、別のAIが書いたかどうかの判定はできません。また、短文は単語選択の回数が少ないため、十分な検出材料が得られません。
制約は用途によっても変わります。
- 校正:元の文章を少し直すだけなら、Claudeが選ぶ単語が少なく、透かしは弱くなります
- 事実文:正解がほぼ一つの箇所では、候補を動かせないため透かしを付けにくくなります
- コード:正確な記述が必要なので、一般文章より透かしが少なくなります
- 編集:軽い修正では残る可能性がありますが、全面的に書き換えれば検出しにくくなります
したがって、「未検出だから人間作」「検出されたから全文AI作」という二択は成立しません。透かしは出自を判断する一つの信号であり、単独の鑑定書ではありません。
組織で使うなら、判定より証拠の束を設計する
EUでは、AI生成コンテンツのマーキング義務が2026年8月2日に適用され、欧州委員会によれば約190組織が透明性に関する行動規範へ署名しました。Anthropicは開始時点で地域を安定して限定する方法がないため、透かしを世界的に適用する方針です。
企業の運用では、検出APIが提供されたとしても、その結果だけで採用、評価、懲戒、著作権判断を自動化すべきではありません。次の4層で扱うのが現実的です。
- 自己申告:AIを使った工程と範囲を記録します
- 技術的信号:テキスト透かしの検出確率を保存します
- 来歴情報:生成履歴、版管理、承認ログを照合します
- 人の判断:用途、影響、反証可能性を確認して結論を出します
画像などの対応ファイルについて、AnthropicはC2PA準拠のContent Credentialsをメタデータへ付ける方針も示しています。C2PAはデジタルコンテンツの作成元や編集履歴を示す公開技術標準です。文章の確率的な透かしと、ファイルの署名付き来歴は役割が違うため、同じ「AI検出」として混ぜないことも大切です。
PL視点では、誤判定時の制御までが仕様
透かし検出を業務へ組み込むなら、精度だけでなく誤判定の影響を先に決める必要があります。確認画面への注意表示なら許容できても、人事評価や不正認定へ直結させるなら要求水準は一気に上がります。
設計レビューでは、少なくとも「未検出時の扱い」「検出時の再確認」「異議申し立て」「ログの保存期間」を仕様に含めるべきです。センサーを追加しただけでは安全システムにならないのと同じで、信号の意味と故障時の振る舞いまで決めて初めて運用できます。
まとめ
- Claudeのテキスト透かしは、自然な単語選択のパターンから関与の可能性を調べる仕組みです
- 利用者情報は含まず、追加文字・追加トークン・実用上の品質低下もないと説明されています
- 短文、軽い校正、事実文、コードでは検出材料が少なくなります
- 検出結果は証拠の一つとして扱い、ログと人の確認を組み合わせるべきです
AI生成物の透明性は「見破る技術」だけでは完成しません。確率的な信号を、誤判定に耐えられる意思決定プロセスへつなぐことが本当の設計課題です。