Anthropicは2026年8月7日、主力モデル「Claude Fable 5」が生物学関連の質問に対して過剰に安全対策を発動し、より能力の低いモデルへ切り替わってしまう「フォールバック」の頻度を、テスト環境で約85%削減したと発表しました。健康状態や検査結果の解釈、教育目的での生物学の学習など、日常的で無害な質問まで安全フィルターに引っかかっていた課題への対応です。
今回の見直しでは、安全対策の可否を判定する分類器の基準(いわば「憲法」)を書き換え、正当な利用ケースを詳細に例外として定義。社内外の専門家からのフィードバックをもとに新しい学習データを作成し、分類器を再訓練しました。Claude.aiでは約67%、Cowork約55%、Claude Code約17%、Claude Platform約7%と、製品ごとにフォールバック発生率が低下する見込みだといいます。
一方で、ウイルス学・毒性学・分子設計など「デュアルユース」性の高い専門領域については、引き続きより慎重な上位モデル(Opus 5)へのフォールバックを維持するとしており、研究者向けの専門利用には適さない設計のままです。安全性と実用性のバランスをどう取るかという、生成AI業界共通の課題への一つの回答例といえます。
出典: Anthropic公式ブログ



