Anthropic、Claude Fable 5.1で蒸留対策を強化 Thinking Blockの文脈改変を検知

Anthropic、Claude Fable 5.1で蒸留対策を強化 Thinking Blockの文脈改変を検知

※記事を視覚化したイメージであり、実際の事象とは異なります。

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

Anthropicは2026年9月1日(米国時間)、AIモデルの出力を大量に収集して別モデルの学習に利用する不正な「モデル蒸留」への対策を強化した。Claude Fable 5.1のMessages APIでは、Thinking Block生成時から過去の会話文脈が書き換えられている場合、対象アカウントの要求をエラーにする。

推論記録と生成時の文脈を照合

Thinking Blockは、Claudeが応答を生成する際の推論を扱うAPI上のブロックで、複数ターンの会話ではsystem prompt、tools、過去のmessagesとともに再送される。

Anthropicによると、新たな処理ではThinking Blockを再送する際、その生成時と同じsystem prompt、tools、messagesが維持されているかを検証する。不一致があれば、対象アカウントではMessages APIが400エラーを返す。

同社は、過去文脈の変更には正当な用途もある一方、産業規模の不正なモデル蒸留で公に文書化された手法でもあると説明している。Fable 5.1では、新規アカウントからこの検証を段階的に適用した。

新規アカウントから段階的に適用

対象は2026年8月31日00:00 UTC以降に作成された新規APIアカウントで、既存アカウントはFable 5.1では対象外となる。

文脈を変更して要求を続ける場合は、該当するThinking Blocksを除去するか、ベータ機能の「drop_block」を指定して影響を受けるブロックをAPI側で除外できる。Anthropicは、将来のモデルではこの仕組みを全利用者に適用する予定としている。

参考・出典

ニュースはAIで深化する—。日々の出来事を深掘りし、次の時代を考える視点をお届けします。

本サイトの記事や画像はAIが公的資料や報道を整理し制作したものです。
ただし誤りや不確定な情報が含まれることがありますので、参考の一助としてご覧いただき、
実際の判断は公的資料や他の報道を直接ご確認ください。
[私たちの取り組み]