auto_awesomeAi Trend
Mistral、マルチモーダル安全分類器Shieldstralを公開―自然言語で判定方針を変更
Mistralは30億パラメータの安全分類器Shieldstralをオープンウェイトで公開。自然言語の質問として方針を渡し、再学習せずテキストと画像を判定する。
概要
※本記事は公開情報をもとに編集部が再構成したサマリです。一次情報は出典欄をご参照ください。
Mistralは2026年8月4日、テキストと画像の安全性を判定する「Shieldstral」を公開した。30億パラメータの小型モデルで、判定したい方針を自然言語の質問として推論時に渡し、内容が該当する確率を返す。
従来の分類器は危険カテゴリを学習時に固定することが多い。Shieldstralは、利用場面に応じた方針を質問文で変更できるため、再学習なしで異なる基準へ対応する設計である。重みはApache 2.0で公開された。
事実のポイント
- 公開日: 2026年8月4日
- 規模: 30億パラメータ
- 対象: テキスト、画像、テキストと画像の組み合わせ
- 方式: 自然言語の方針質問に対する連続的な安全スコア
- 提供: Apache 2.0のオープンウェイト
用語・背景の補足
安全分類器は、利用者の入力やAIの出力を検査し、禁止対象や要確認内容を判定する補助モデルである。業務ごとに許容範囲が違うため、固定カテゴリだけでは過剰拒否や見逃しが起きやすい。
連続スコアを返す方式では、一定以上なら拒否、中間なら人へ確認といった段階的な運用ができる。ただし、しきい値と質問文の設計が結果へ影響するため、実際のデータで調整する必要がある。
注意点
- 公表ベンチマークは特定データセット上の結果であり、個別用途の性能を保証しない
- 自由な方針設定は柔軟だが、曖昧な質問文では判定も不安定になりうる
- 単独の分類器に依存せず、権限管理と人による確認を組み合わせる必要がある
編集部見解
(追記予定)
info 公開情報をもとに編集部が再構成したサマリです。一次情報・追加情報は出典欄をご参照ください。