auto_awesomeAi Trend
Anthropic、Fable 5の生物学セーフガードを調整―誤検知を約85%削減
Anthropicは、Claude Fable 5の生物学関連分類器を更新し、無害な質問が別モデルへ切り替わる頻度を社内試験で約85%削減した。高リスクの専門用途は引き続き制限する。
概要
※本記事は公開情報をもとに編集部が再構成したサマリです。一次情報は出典欄をご参照ください。
Anthropicは2026年8月7日、Claude Fable 5に適用する生物学分野の安全分類器を更新した。日常的な健康情報や教育目的の質問まで高リスクと判定され、別モデルへ切り替わる誤検知を減らすことが目的である。
同社の試験では、生物学関連の切り替えが従来比で約85%減少した。一方、ウイルス学、毒性学、分子設計など専門的なデュアルユース領域は引き続き保護対象とし、より能力の限定されたモデルへ処理を移す。
事実のポイント
- 発表日: 2026年8月7日
- 変更内容: 生物学関連の安全分類器を再学習
- 公表結果: 社内試験で関連する切り替えを約85%削減
- 継続制限: 高リスクの専門研究やデュアルユースの依頼
用語・背景の補足
安全分類器は、利用者の入力やモデル出力を別のAIで判定し、高リスクとみなした処理を止めたり迂回させたりする仕組みである。判定範囲を広げると危険な依頼を見逃しにくくなる一方、正当な利用まで止める誤検知が増える。安全性と有用性の境界を継続的に検証する必要がある。
注意点
- 削減率はAnthropicによる試験結果で、実環境の全利用を保証しない
- 誤検知の減少が、危険な依頼の見逃し増加につながらないか継続評価が必要
- 健康や研究に関する回答は、用途に応じて専門家と一次資料による確認が必要
編集部見解
(追記予定)
info 公開情報をもとに編集部が再構成したサマリです。一次情報・追加情報は出典欄をご参照ください。