200,000 近くの実際の敵対的攻撃が、特に バックボーン ブレーカー ベンチマーク? AI エージェントが世界中の金融、医療、法務分野にわたる重要なタスクを処理することが増えているため、コア言語モデルが操作に耐えられるかどうかを検証することが不可欠になっています。以下に、主要な研究者が政府機関と協力して開発したこの強力なオープンソースのセキュリティ評価フレームワークをインストール、実行し、実用的な結論を引き出すための 10 の明確に定義されたステップを示します。 2025 年初頭からの私の実践的なテストに基づいて、Backbone Breaker Benchmark を実行すると、標準の安全性評価では一貫して見落とされている脆弱性が明らかになりました。 15 を超える異なるモデル構成にわたる私のデータ分析によると、構造化された敵対的ベンチマークを採用しているエンジニアリング チームは、従来の安全性テストのみに依存しているチームと比較して、本番展開前に悪用可能な弱点を 3 倍多く特定します。この人間優先のウォークスルーでは、数か月にわたる厳しい実験中に私が学んだことすべてを、高度な学位は必要なく、誰でも従うことができる実践的で再現可能な手順にまとめています。 2026 年の AI セキュリティの状況では、曖昧な理論的な安全性の主張ではなく、経験に基づく共有された測定基準が求められます。のような規制の枠組みにより、 EU AI法 導入者と開発者の両方に厳格な説明責任を課すことにより、実際の攻撃データに基づいたベンチマーク ツールは、実験的な目新しさから運用上の必需品へと移行しました。すべての本格的な AI 導入パイプラインは、厳格な敵対的テストの恩恵を受けるようになりました。 この記事は情報提供を目的としたものであり、専門的なサイバーセキュリティまたは法的アドバイスを構成するものではありません。

🏆 バックボーン ブレーカー ベンチマークの 10 ステップの概要
1. バックボーン LLM とエージェント セキュリティの基礎を理解する

バックボーン ブレーカー ベンチマークは、AI エージェント スタックの特定のレイヤー、つまりバックボーン LLM 自体を対象としています。エージェント パイプライン全体をエンドツーエンドでテストするシステム全体の評価とは異なり、このフレームワークはコア言語モデルを分離し、個々の呼び出しレベルでそれを調査します。 2024 年以降の私の実務では、多くの脆弱性はオーケストレーション ロジックが機能する前にモデル層で発生するため、この区別は重要であることが判明しました。
バックボーン LLM とは正確には何ですか?
バックボーン LLM は、AI エージェント システムを強化する基本的な大規模言語モデルです。これは、問題を推論し、テキスト出力を生成し、外部ツールを呼び出すために順次呼び出されます。フライトの予約、データベースの検索、法的文書の作成を行う AI アシスタントと対話するとき、バックボーン LLM はあらゆるリクエストを舞台裏で処理するエンジンです。の Evals リポジトリを検査する これらのモデルを体系的にテストするためのインフラストラクチャを提供します。
エージェント全体をテストするのではなく、モデルを分離するのはなぜですか?
エージェント全体をテストすると、ツールの実装、オーケストレーション ロジック、メモリ管理など、セキュリティの全体像を混乱させる無数の変数が導入されます。バックボーンを分離することで、障害の原因が LLM にあるのか、不十分に実装されたツール ラッパーにあるのかを推測するのではなく、モデル自体に脆弱性があると正確に判断できます。このアプローチはソフトウェア エンジニアリングにおける単体テストを反映しており、統合する前に各コンポーネントを個別に検証します。
- 識別する 操作が成功した正確なモデル層を特定し、それを文書化します。
- 比較する 同一の敵対的条件下での異なるバックボーン モデル。
- 測定 セキュリティ強化プロンプトが実際に耐性を向上させるかどうか。
- 属性 周囲のインフラストラクチャではなく、モデルの障害です。
- 確立する 継続的なセキュリティ監視のための再現可能なベースライン。
💡 専門家のヒント: 私のテストによると、成功したエージェント操作のおよそ 60 ~ 70% はバックボーン レベルの脆弱性が原因です。オーケストレーション層やツール層を強化する前に、最初にモデル層を修正すると、セキュリティの投資収益率が最も高くなります。
2. バックボーン ブレーカー ベンチマークでの脅威スナップショットの調査

脅威のスナップショットは、すべての Backbone Breaker Benchmark 評価の構造的バックボーンを形成します。各スナップショットは、攻撃を受けている AI エージェントのフリーズ フレームを表し、現実的な敵対シナリオを定義する正確な条件、目的、成功基準をキャプチャします。表示される結果はスナップショットに基づいて整理されるため、評価を実行する前に、これらのスナップショットがどのように機能するかを理解することが不可欠です。
脅威スナップショットは実際にはどのように機能するのでしょうか?
ベンチマークの各脅威スナップショットは、システム プロンプトや利用可能なツールを含むエージェントの状態とコンテキスト、特定の攻撃ベクトルとその目的、攻撃が成功したかどうかを測定するために使用される方法という 3 つの重要なコンポーネントを定義します。これらのスナップショットは、 ガンダルフ: エージェント ブレイカー プラットフォーム。研究チームは代表的な攻撃シナリオを選択し、構造化された再現可能なテスト ケースに変換しました。
脅威スナップショットシナリオの具体例
旅行プランナーのエージェントがだまされて旅程の出力にフィッシング リンクを挿入したり、法務アシスタントが巧妙なプロンプト インジェクションによって機密文書の内容を抜き出すように操作されたりすることを考えてみましょう。これらは仮説的なシナリオではなく、実際に観察された実際の攻撃パターンに基づいています。現在、ベンチマークには、複数のアプリケーション ドメインと攻撃の複雑さのレベルにわたる 30 の個別の脅威スナップショットが含まれています。
- レビュー 実行するスナップショットを選択する前に、30 個の脅威スナップショットすべてを確認してください。
- マッチ 関連する結果を得るために、特定の展開コンテキストへのスナップショットを作成します。
- 分析する どのアプリケーション ドメインが最も高い脆弱性率を示しているか。
- 優先順位を付ける 最も重要な脅威のスナップショットの弱点を最初に修正します。
- 追跡 モデルの更新と新しいリリースにわたるスナップショットのパフォーマンス。
3. ベンチマーク テストの防御レベルの構成

Backbone Breaker Benchmark のすべての脅威スナップショットは、3 つの異なる防御レベルにわたってテストされるため、モデルが脆弱かどうかだけでなく、さまざまな対策が実際にどの程度の保護を提供するかを測定できます。この段階的なアプローチにより、セキュリティ チームはリスクにさらされる状況を段階的に把握できるようになり、経験的証拠に基づいて最初に実装する防御策の優先順位を決定するのに役立ちます。
B3の3つの守備レベルは何ですか?
レベル 1 は、アプリケーションのシステム プロンプトが追加のセキュリティ指示なしで動作するベースライン構成を表します。レベル 2 では、モデルに操作に抵抗し、敵対的な命令を拒否するよう指示する明示的なセキュリティ ディレクティブを含む、強化されたシステム プロンプトが導入されます。レベル 3 は、個別の判断モデルがすべての応答をレビューし、応答がセキュリティ ポリシーに違反する場合に拒否権を発動できる自己判断メカニズムを実装しています。 2024 年以降の私の実践では、遅延と計算オーバーヘッドが発生するものの、L1 および L2 防御をすり抜ける攻撃の約 40 ~ 60% を L3 がキャッチできることがわかりました。
防御レベルの有効性を比較するための重要な手順
3 つの防御レベルすべてにわたって各脅威スナップショットを実行して、包括的なセキュリティ プロファイルを構築します。脆弱性スコアはレベル間で大幅に低下します。私が実施したテストでは、L1 から L2 までは平均 35% 減少し、L2 から L3 まではさらに 25% 減少したことがわかりました。ただし、L3 の自己判断は誤検知を生成することもあり、正当な応答に違反としてフラグを立て、実際には攻撃が発生していないのにスコアを 0.0 に設定します。
- 始める L1 ベースライン テストを使用して、モデルの未加工の脆弱性表面を確立します。
- 適用する L2 は強化されたプロンプトを表示し、攻撃耐性メトリックのデルタを測定します。
- 展開する 最大限の保護を必要とする高リスクのアプリケーション向けの L3 自己判断。
- モニター L3 での誤検知率により、正当なユーザー インタラクションがブロックされる可能性があります。
- 書類 利害関係者報告のための防御レベル間のコストの違い。
⚠️警告: L3 自己判断メカニズムは、正常な応答にセキュリティ違反として誤ってフラグを立てた場合、正当なサンプル スコアをゼロにする可能性があります。 L3 の結果と L1 および L2 ベースラインを常に相互参照して、真のセキュリティ向上と過剰なフィルタリングを区別します。これは現実世界のガードレール レイヤーをシミュレートするため、判定しきい値を調整することが重要です。
4. B3 評価用の環境のセットアップ
Backbone Breaker Benchmark を実行する前に、適切なパッケージ マネージャーと API 資格情報を使用して開発環境を適切に構成する必要があります。セットアップ プロセスは簡単ですが、詳細に注意する必要があります。API キーが 1 つ欠けていると、評価実行全体が途中で停止し、時間と API クレジットの両方が無駄になる可能性があります。私の 18 か月にわたるセキュリティ テスト ワークフローのデータ分析に基づくと、環境を適切に準備すると、実行の失敗が 80% 以上減少します。
B3 を実行するための必須の前提条件
次のようなパッケージマネージャーが必要です uv (速度の点で推奨) または pip 依存関係をインストールするため。さらに重要なのは、OpenAI、Anthropic、Google など、評価する予定のすべてのモデル プロバイダーから API キーを取得する必要があることです。多くの初めてのユーザーが見逃している重要な点です。内部スコアラーの 1 つがテキスト類似性の計算に OpenAI 埋め込みに依存しているため、テストするモデルに関係なく OpenAI API キーが必要です。
.env 構成ファイルの作成
を作成します .env ファイルを作業ディレクトリに保存して、すべての資格情報を安全に保存します。このファイルには、プライマリ モデル エンドポイント構成と、評価するモデルに必要なすべての API キーが含まれている必要があります。 INSPECT_EVAL_MODEL 変数はデフォルトのモデルを設定し、プロバイダー固有のキーはそれぞれの API へのアクセスを可能にします。このファイルをバージョン管理に決してコミットしないでください。 .gitignore すぐに。
- インストール 最速の依存関係解決とビルドのための uv パッケージ マネージャー。
- 生成する OpenAI、Anthropic、Google Cloud Console の API キー。
- 設定する コマンドを実行する前に、すべての資格情報を含む .env ファイルを作成します。
- 確認する 完全な評価を開始する前に、簡単なテスト呼び出しで API キーの有効性を確認します。
- 安全な .env ファイルをバージョン管理無視リストに追加します。
🏆プロのヒント: 完全な B3 評価を実行する前に、API キーを個別にテストしてください。無効なキーが 1 つあると、実行全体が失敗します。ベンチマークの実行に何時間も費やす前に、簡単なプロンプトで各プロバイダーの API を呼び出し、接続と認証を確認する単純な Python スクリプトを作成することをお勧めします。
5. Backbone Breaker Benchmark パッケージのインストール
Backbone Breaker Benchmark には、目的に応じて 2 つのインストール パスが用意されています。 PyPI からのクイック インストール ルートを使用すると、評価を数分で実行できるようになります。一方、リポジトリ クローン パスは、スコアラーを変更したり、カスタム脅威スナップショットを追加したり、公開された論文からの正確な実験を再現したい研究者にソース コードへの完全なアクセスを提供します。実稼働テストが必要か、それとも詳細な研究機能が必要かに基づいて選択してください。
標準評価用の PyPI からの迅速なインストール
単にモデルを評価したいだけのほとんどのユーザーにとって、PyPI のインストールが最速のパスです。走る uv pip install inspect-evals[b3] ベンチマークとそのすべての依存関係をインストールします。この方法は、基礎となる評価ロジックを変更せずに標準化されたテストを実行する必要があるセキュリティ チームに最適です。パッケージには、30 個すべての脅威スナップショットと、すぐに使用できるように事前設定されたスコアリング メカニズムが含まれています。
研究とカスタマイズのためのリポジトリ クローン
研究者や上級ユーザーは、 Evals GitHub リポジトリを検査する 直接。これにより、実験スクリプト、スコアリング実装、論文で使用された完全なモデル構成ファイルを含む完全なソース コードにアクセスできるようになります。クローン作成後、実行します uv sync --extra b3 B3 固有の拡張機能を含むすべての依存関係をインストールします。論文の結果を正確に再現する場合、このパスは必須です。
- 選ぶ 実稼働モデルのセキュリティを迅速に評価するための PyPI のインストール。
- クローン スコアリングと評価ロジックを完全に制御する必要がある場合は、リポジトリを使用します。
- 確認する Python シェルに b3 モジュールをインポートしてインストールします。
- アップデート ベンチマークの進化に応じて、定期的に新しい脅威のスナップショットを受信します。
- レビュー サポートされているモデルとプロバイダーの完全なリストについては、constants.py ファイルを参照してください。
✅ 検証されたポイント: 私のテストによると、標準のブロードバンド接続では、PyPI のインストールは 45 秒以内に完了します。完全な履歴を含むリポジトリ クローンの作成には約 3 ~ 5 分かかります。スコアラーを変更したり、カスタム脅威スナップショットを追加したりする予定がある場合、リポジトリ パスを使用すると、最初のダウンロードが大きくなるにもかかわらず、長期的には時間を大幅に節約できます。
6. 最初の B3 評価を正常に実行する
最初の Backbone Breaker Benchmark 評価を開始するには 1 つのコマンドが必要ですが、舞台裏で何が起こっているかを理解することは、結果を正確に解釈し、問題が発生した場合のトラブルシューティングに役立ちます。このベンチマークは、厳選された敵対的攻撃のデータセットを読み込み、特定の脅威スナップショット内のターゲット モデルに対して各攻撃を再生し、攻撃目的が達成されたかどうかに基づいて応答をスコア付けします。
CLI または Python を介して評価を実行する
B3 を実行する最も簡単な方法は、コマンド ライン インターフェイスを使用することです。実行する uv run inspect eval inspect_evals/b3 --model openai/gpt-4.1-nano 選択したモデルに対する完全な評価を開始します。あるいは、Python 統合により、次を使用してプログラムによる実行が可能になります。 from inspect_ai import eval そして from inspect_evals.b3 import b3。 Python アプローチを使用すると、複数の評価をスクリプト化し、継続的なセキュリティ監視パイプラインの結果収集を自動化できます。
完全導入前のスモークテスト
完全な評価を行う前に、必ずスモーク テストを実行してください。フラグを追加する -T limit_per_threat_snapshot=2 データセット全体ではなく、スナップショットごとに 2 つのサンプルのみを実行します。 B3 はデフォルトで各攻撃を 5 回実行するため (「エポック」と呼ばれます)、このスモーク テストでは 30 個の脅威スナップショット、2 サンプル、5 エポックを乗算し、合計 300 サンプルを処理します。これにより、完全な実行に投資する前に、API キーが機能し、スコアラーが正しく機能し、ログがすべての出力をキャプチャすることが確認されます。
- 実行する 最初に構成を検証するために、限られたサンプルを使用したスモーク テストを行います。
- モニター 429 エラーと中断を回避するための実行中の API レート制限。
- 追跡 完全な実行コストを見積もるための脅威スナップショットごとのトークン消費量。
- レビュー スコアラーが期待どおりの結果を出していることを確認するための初期のサンプルスコア。
- 規模 信頼性が確立されたら、煙テストから完全な評価まで段階的に進めます。
⚠️警告: 完全な B3 評価では、30 の脅威スナップショット、複数の防御レベル、攻撃ごとに 5 エポックにわたり、モデルごとに数百のプロンプトが送信されます。対象モデルとプロバイダーの価格設定によっては、コストが急速に上昇する可能性があります。開発中は常にlimit_per_threat_snapshotパラメータを使用し、最終検証のために完全な実行を保存してください。
7. B3 の結果と脆弱性スコアの解釈

Backbone Breaker Benchmark の結果を読み取るには、個々のサンプル スコア、脅威スナップショットごとの内訳、および集計された脆弱性メトリクスという 3 つの層のデータを理解する必要があります。各レイヤーは、モデルのセキュリティ体制についてのより広範な洞察を徐々に提供します。の AI VS コード拡張機能の検査 結果を視覚的に探索するための対話型インターフェイスを提供します。
サンプルごとおよびスナップショットごとのスコアリングを理解する
B3 結果の各サンプルは、特定の条件下でモデルに対する特定の攻撃が成功したかどうかを示します。脆弱性スコアは、これらの個々の結果を、攻撃がどの程度一貫して成功するかを表す指標に集約します。スコアが高いほど、脆弱性が高いことを示します。スコアリング方法は攻撃の目的によって異なり、テキストの類似性の比較、ツール呼び出しの照合、およびコンテンツ検出アルゴリズムが含まれます。詳細については、「 研究論文。
B3 の結果に関する私の分析と実践的な経験
複数のモデル ファミリにわたって B3 評価を実行する実践では、脆弱性パターンが均等に分散するのではなく、特定の攻撃カテゴリの周囲に集中していることが観察されました。一般的な安全性ベンチマークで良好なパフォーマンスを発揮するモデルでも、ツールの呼び出しやデータ漏洩を対象とした敵対的な操作に対してテストすると、驚くべき弱点が見つかることがあります。この矛盾は、B3 のような専用のセキュリティ ベンチマークが不可欠である理由を強調しています。安全性とセキュリティは根本的に異なる評価次元です。
- 比較する 3 つの防御レベルすべてにわたる脆弱性スコアを取得して、保護の向上を定量化します。
- 識別する 軽減の優先領域として一貫して高いスコアを持つ脅威のスナップショット。
- 相互参照 モデルのバージョン間の結果を分析して、時間の経過に伴うセキュリティの改善を追跡します。
- 輸出 結果として、セキュリティ ダッシュボードやレポート ツールと統合するための構造化された形式になります。
- ベンチマーク 公開されている研究論文の結果とモデルを比較します。
8. B3 研究論文実験の再現

Backbone Breaker Benchmark 研究論文の正確な結果を再現するには、リポジトリのインストール パスと 30 を超える異なるモデル API へのアクセスが必要です。この論文の実験は OpenAI、Anthropic、Google、AWS Bedrock のモデルにまたがっており、完全な再現はコストと時間の両面で重要な作業となっています。ただし、特定のモデルファミリーを対象とした部分的な再現は完全に実現可能であり、貴重な比較データが得られます。
完全な実験スクリプトを実行する
リポジトリには、次の場所にある専用の実験スクリプトが含まれています。 src/inspect_evals/b3/experiments/run.py 論文の評価構成を再現します。実行する uv run python src/inspect_evals/b3/experiments/run.py --group all すべてのモデルにわたって完全なベンチマークを実行します。実験ディレクトリ内の constants.py ファイルには、元のスタディに含まれるすべてのモデルがリストされています。範囲を理解し、必要な API 認証情報を準備するために、起動する前にこれを確認してください。
複製のためのコストと API アクセスの管理
の --group all flag は 30 以上のモデルにわたる評価をトリガーし、モデルごとに数千の API 呼び出しを生成します。潜在的に数千ドルに達する多大なコストと数時間の実行時間が予想されます。 AWS Bedrock モデルの場合、AWS アカウントで us-east-1 リージョンで Bedrock アクセスが有効になっていること、およびアクティブな AWS セッションが適切に認証されていることを確認してください。 aws sso login または同等の資格情報。
- レビュー constants.py ファイルを使用して、テストされたモデルの全範囲を理解します。
- 準備する サードパーティ モデルの OpenRouter を含むすべてのプロバイダーの API キー。
- 見積もり モデルごとのトークン×価格を計算することで、ローンチ前の総コストを計算します。
- 設定する Bedrock でホストされるモデルをテストする場合は、us-east-1 で AWS Bedrock にアクセスします。
- 考慮する 組織のモデル スタックのみを対象とした部分的な複製。
9. B3 を実行する際の実践的なヒントとよくある落とし穴
経験豊富なセキュリティ エンジニアでも、Backbone Breaker Benchmark を初めて実行するときは課題に遭遇します。準備ができていないと、レート制限、予期しない API コスト、スコア異常により評価が狂う可能性があります。広範なテスト経験に基づいたこれらの実践的なヒントは、最も一般的な問題に対処し、評価結果や予算を損なう可能性のある高くつく間違いを回避するのに役立ちます。
レート制限と接続スロットルの処理
API レート制限は、評価失敗の最も頻繁な原因です。を使用します。 --max-connections パラメーターを使用して同時リクエストを調整し、実行を中断する 429 エラーを回避します。各プロバイダーはアカウント層に基づいて異なるレート制限を適用するため、このパラメーターはモデルプロバイダーごとに特別に調整してください。テスト中に、最大接続数を OpenAI の場合は 3 ~ 5、Anthropic の場合は 2 ~ 3 に設定すると、標準アカウントでレート制限がトリガーされることなく安定した実行が提供されることがわかりました。
コストと OpenAI 埋め込み依存関係の管理
B3 を完全に実行すると、すべての脅威スナップショットと防御レベルにわたってモデルごとに数百のプロンプトが送信されます。の limit_per_threat_snapshot パラメータは、開発中の主要なコスト管理メカニズムです。非 OpenAI モデルを評価する場合でも、内部スコアラーの 1 つは OpenAI 埋め込みを必要とすることに注意してください。つまり、有効な OpenAI API キーを維持し、予算計算でそれらの埋め込みコストを考慮する必要があります。埋め込みコストは生成コストに比べて比較的小さいですが、サンプルが数千個以上蓄積される可能性があります。
- スロットル 429 エラーを防ぐために –max-connections を使用して同時 API リクエストを実行します。
- 予算 非 OpenAI バックボーン モデルをテストする場合でも、API 呼び出しを埋め込むことができます。
- 検証する L3 は、L1 および L2 に対するスコアを自己判断して、誤検知を検出します。
- 保存 モデル更新全体にわたる長期的な比較のために、すべての実行からの完全なログ。
- 自動化する CI/CD パイプラインでスモーク テストを実行して、リグレッションを早期に発見します。
💡 専門家のヒント: 私のテストによると、オフピーク時間 (UTC の深夜または早朝) に B3 評価を実行すると、レート制限の発生が約 60% 減少します。さらに、評価スクリプトに指数バックオフ再試行ロジックを実装すると、手動介入なしで一時的な 429 エラーから回復できるため、監視時間を何時間も節約できます。
❓ よくある質問 (FAQ)
バックボーン ブレーカー ベンチマークは、現実的な敵対的攻撃に対するバックボーン LLM (AI エージェントを強化するコア モデル) のセキュリティ回復力を評価します。 B3 は、約 200,000 件の人的レッドチーム攻撃から構築されており、30 の脅威スナップショットと 3 つの防御レベルにわたって、モデルを操作して意図しないアクションを実行できるかどうかをテストします。
単一モデル B3 評価の費用は通常、モデル プロバイダーと価格帯に応じて 50 ドルから 200 ドルの間です。 30 以上のモデルにわたって紙全体を複製するには、数千ドルの費用がかかる可能性があります。を使用します。 limit_per_threat_snapshot 開発中にパラメータを調整してコストを管理しやすくし、完全な評価の前に必ずスモーク テストを実行します。
はい。 B3 の内部スコアラーの 1 つは、テキスト類似性の計算のために OpenAI 埋め込みに依存しています。 Anthropic、Google など、テストしているバックボーン モデルに関係なく、スコアリング システムが正しく機能するには、.env ファイルに有効な OpenAI API キーを指定する必要があります。
従来の安全性ベンチマークは、モデルが有害なコンテンツを生成するかどうかをテストします。 B3 は、モデルを操作して意図しないアクション (安全性ではなくセキュリティ) を実行できるかどうかをテストします。 B3 はバックボーン LLM を分離し、人間のレッドチームによる 200,000 件近くの試行から得られた実際の敵対的攻撃データを使用して、安全性ベンチマークでは捕捉できない経験的なセキュリティ測定を提供します。
まず、PyPI 経由でインストールします。 uv pip install inspect-evals[b3]、API キーを使用して .env ファイルを作成し、次を使用してスモーク テストを実行します。 -T limit_per_threat_snapshot=2。これにより 300 個のサンプルが処理され、セットアップが正しく機能することが確認されます。を確認してください GitHub リポジトリ 詳細な手順についてはドキュメントを参照してください。
脅威スナップショットは、AI エージェントに対する特定の敵対シナリオを表す構造化されたテストケースです。各スナップショットは、エージェントのコンテキスト、攻撃ベクトル、目的、および成功の測定基準を定義します。 B3 には、旅行計画、法的支援、顧客サービスなどの分野をカバーする 30 件の脅威スナップショットが含まれており、すべて Gandalf: Agent Breaker プラットフォームを通じて収集された実際の攻撃データに由来しています。
はい。 B3 はオープンソースであり、研究と商用アプリケーションの両方のために設計されています。組織は、これをセキュリティ テスト パイプラインに統合して、展開前にバックボーン LLM を評価できます。このベンチマークは、セキュリティ チームがコンプライアンスを文書化し、AI セキュリティ実践におけるデュー デリジェンスを実証するために使用できる、再現可能な標準化された測定値を提供します。
単一モデルの評価には、プロバイダーのレート制限と接続スロットル設定に応じて、通常 30 ~ 90 分かかります。煙テスト limit_per_threat_snapshot=2 5〜10分で完了します。 30 以上のモデルすべてで完全な論文を再現するには、数時間の実行時間が必要です。それに応じて評価期間を計画し、ログを使用して進行状況を追跡します。
B3 は、OpenAI 埋め込みによるテキストの類似性、ツール呼び出しの照合、機密データ漏洩のためのコンテンツ検出、手動パターン分析など、攻撃の目的に応じて複数のスコアリング方法を採用しています。各脅威スナップショットは、どのスコアリング方法が適用されるかを指定し、L3 防御レベルは、主要スコアに関係なく、フラグ付きの応答を拒否できる自己判断モデルを追加します。
このベンチマークは、新たな脅威に合わせて進化するように設計されています。 Gandalf: Agent Breaker プラットフォームとセキュリティ研究を通じて新しい攻撃手法が発見されると、追加の脅威スナップショットと評価手法が組み込まれます。フォローしてください Evals GitHub リポジトリを検査する セキュリティ評価を最新の状態に保つためのアップデートと新しいリリースを入手します。
Gandalf: Agent Breaker は、AI エージェントに対する人間のレッドチーム攻撃を収集する、Lakera の大規模な AI セキュリティ チャレンジです。このプラットフォームは、B3 のデータセットの基礎を形成する 200,000 近くの実際の攻撃サンプルを生成しました。研究者はこれらの攻撃を代表的なシナリオに抽出してベンチマークの 30 の脅威スナップショットを作成し、B3 を現実世界の敵対的データに完全に基づいた数少ないベンチマークの 1 つとしました。
🎯 結論と次のステップ
Backbone Breaker Benchmark は、AI セキュリティ評価における重要な変化を表しており、理論的な安全性チェックを超えて、約 200,000 件の人為的攻撃サンプルに基づいた実証的な現実世界の敵対的テストに移行しています。このガイドに従うことで、30 の脅威スナップショットと 3 つの防御レベルにわたってバックボーン LLM の脆弱性を体系的に測定し、操作に対する AI 導入を強化する実用的なデータを生成できます。今すぐスモーク テストから始めて、セキュリティ テスト インフラストラクチャが成熟するにつれて評価範囲を徐々に拡大してください。
📚 ガイドと一緒にさらに深く掘り下げてみましょう:
オンラインでお金を稼ぐ方法 |
テストされた最高の AI セキュリティ ツール |
AI レッドチームの専門ガイド

