TL;DR — 大手オープンマーケットプレイスのスキルのおよそ 8 つに 1 つが、悪意あるものでした。持続的な攻撃の下では、テストされたすべてのフロンティアモデルがプロンプトインジェクションに陥ります。研究が指し示す解は、より良いフィルターではなくアーキテクチャ——行動をモデルの外側で統治すること。myOrbit はそのように建てられています。このノートはその証拠で、出典はすべてクリックできます。
8 つに 1 つ
2026 年 2 月、Koi Security の研究者たちが、オープンソースのエージェント OpenClaw 向けのコミュニティスキルマーケットプレイス ClawHub を調査しました。調べたスキルのうち、2,857 件中 341 件が悪意あるものでした。およそ 12 パーセント、およそ 8 つに 1 つです。天気ウィジェットやカレンダー補助をインストールしているつもりの人々に、Atomic macOS Stealer、キーロガー、リバースシェルを届けていました。この一件には ClawHavoc というコードネームと、サプライチェーンの事後検証がつきました。
教訓は、あるマーケットプレイスがひと月ひどい目にあった、ということではありません。教訓は、開かれたエージェントマーケットプレイスとは何なのか、ということです。それは、誰でもコードを公開でき、そのコードがあなたのエージェントの手と、あなたのファイルと、あなたの認証情報を使って動く流通経路です。攻撃者は、ほとんどのユーザーより先にそれに気づきました。
清潔なリリース 15 回、そして 231 行目
マーケットプレイスは、ひとつの入り口です。パッケージは、もうひとつです。
2025 年 9 月、セキュリティコミュニティは公に知られた最初の悪意ある MCP サーバーを記録しました。postmark-mcp という npm パッケージで、15 回のリリースのあいだ、忠実に仕事をしていました。そしてバージョン 1.0.16 で、たった 1 行——231 行目——が、送信されるすべてのメールを黙って BCC するようになりました。宛先は作者自身のサーバーです。パスワードリセット、請求書、機密のスレッド。接続されたエージェントが送るもの、すべて。Snyk の分析がそのコードを追い、名前を無断で借りられた Postmark 社——このパッケージとは何の関係もありません——は、自ら注意喚起を出すことになりました。
15 回の清潔なリリース、という細部こそ、腰を据えて考える価値があります。パッケージを一度監査してわかるのは、それが何だったかであって、次の更新が何になるかではありません。開かれたサプライチェーンでは、すべての更新が、あなたではない誰かによる新しい決定です。
モデル層は、あなたを救わない
サプライチェーンをすり抜けたものを、モデル自身が捕まえられるのではないか。計測された答えは、ノーです。プロダクト全体をフロンティアモデルの上で動かしている私が、そう言います。これは技術への恐れではありません。データへの敬意です。
Gray Swan の間接プロンプトインジェクションのベンチマークでは、テストされた中で最もインジェクションに強いフロンティアモデルでさえ、10 回の試行を与えれば 3 分の 1 の割合——33.6 パーセント——で強力なインジェクションに陥り、100 回なら 63 パーセントで陥ります。英国 AI Security Institute と Gray Swan がレッドチームのチャレンジを実施したとき、22 のフロンティアモデルに対して合計 180 万回の攻撃が行われ、すべてのモデルが破られました。そして標的とした挙動のほとんどは 10 回から 100 回のクエリの範囲で陥落しました。NIST の CAISI も、大規模なレッドチーミングを自ら検討した結果、同じ結論に至っています。
ここでベンダーの順位づけをするつもりは、意図的にありません。表は公開されていますから、リンクをたどってください。重要なのは全体像です。今日、どのラボのどのフロンティアモデルも、本気のインジェクション攻撃者に耐えられません。汚染されたスキルや、罠を仕掛けられたウェブページは、毎回モデルに勝つ必要はありません。一度勝てば足ります。
攻撃者は、あとから動く
防御が差を埋められないのか。埋まらないままです。“The Attacker Moves Second” という率直な題の論文——OpenAI、Anthropic、Google DeepMind にまたがる研究者たちによるものです——は、適応的な攻撃が、公表された 12 のプロンプトインジェクション防御を突破することを示しました。そのほとんどで、成功率は 90 パーセントを超えています。防御が出荷され、攻撃者が適応し、防御が破られる。それがループであり、最後に動くのはいつも攻撃者です。
だからこそ、最も興味深い研究の応答は、もうひとつのフィルターではありません。Google DeepMind と ETH チューリッヒの CaMeL 論文は、それを題名で言い切っています。Defeating Prompt Injections by Design。モデルにインジェクションへの抵抗を求めるのではない。注入されたテキストが、そもそも行為に至らないようにシステムを建てる。
算術も、反対側から同じことを言います。1 ステップあたり 95 パーセント信頼できるエージェントは、20 ステップ目には 36 パーセントです。0.95 の 20 乗は 0.358 です。長く走るエージェントは、リスクを運ぶだけではありません。積み上げます。確率的な防御は、指数に負けます。構造は負けません。
研究者が求めるとおりに建てる
これが、myOrbit が想定している脅威モデルであり、その答えは志ではなくアーキテクチャです。
私は、開かれたスキルマーケットプレイスを運営していません。ここのエージェントが使う MCP サーバーとスキルはファーストパーティです。名前を挙げられる作者のいるサプライチェーンであって、2,857 の露店が並び税関のない市場ではありません。
そして、ツールが返すものと、エージェントがそれに対して何をするかのあいだには、統治されたパイプラインがあります。すべての行動に対する、拒否が優先されるひとつのゲート。モデルの外側で執行されるガードレール。異常を止めて人に手渡すトリップワイヤー。それはまさに、研究が指し示している制御です。そもそもモデルの文脈の中に一度も置かれていなかったからこそ成立する規則が、Echo OS の上でも、エージェントが行為するあらゆる場所でも働いています。
このどれも、エージェントを恐れる理由ではありません。彼らの世界を正しく建てる理由です——そしてそれは、建てられる問題です。開かれたエコシステムは、エージェントに到達範囲を与えました。8 つに 1 つというのが、法のない到達範囲の代償です。
私は、法を選びました。
この考えを持ち帰る
正規のソースを共有するか、使っている AI のための読書プロンプトをコピーできます。
— orbiteer1