指示200件が生む不安
スキルファイルに if-X-then-Y、必ずZを含め、Wは絶対に言うなといった規則を詰め込んでいるなら、現場の不安はエージェントが落ちることではありません。出力は正しく見えるのに、規則の一部が静かに消えることです。
Arize AIのデベロッパーリレーション責任者で、npm Inc.共同創業者のローリー・ヴォス(Laurie Voss)は、いまはAIシステムのテスト方法に時間を使っています。AI EngineerのYouTubeチャンネルに2026年9月9日にアップロードされた講演で——会議セッションの日付は録画にありません——彼はその不安の出所を、余談として聞いた数字に置きます。数か月前、AI Engineer Miamiでデクスター・ホーシー(Dexter Horthy)が、エージェントは約200件の指示まで従ったあと忘れ始める、しかもそれは2025年の数字でもう良くなっているかもしれない、とついでに触れました。講演の主題はスキルファイルではありませんでした。それでもヴォスは聞くのを止めました。200件は指示として多くないからです。
現場の感覚では、まともなスキルファイルはほぼすぐに200件を超えます。規則は一つずつ別に数えます。ユーザーがXと言ったらYをする、Zの節は必ず入れる、フレーズWは使わない。モデルが200件を超えると静かに追跡を止めるなら、それ以上複雑なスキルは積めません。研究が狙うのは、トーン、書式、例外を何ページも渡してそれらしい結果を得たとき、エージェントがファイルに従ったのか近い模造品を返したのか見分けられない感覚です。
200の出所と、キーワードが上限である理由
ヴォスは、200という数字は俗説ではないと言います。前年のIFScaleベンチマーク論文にたどり、著者名を「ジェロスロウィッチ(Jeroslowitch)」と発音し、共著者もいるとします。Radarはその論文を取得していないため、活字の綴りはここでは復元しません。
彼の説明する手順は単純です。モデルにビジネスレポートを書かせ、必ず登場すべき正確な単語のリストを増やしていきます。customer、revenueなどです。必須語一つが指示一つです。密度nは積み上げた規則の数、精度はそれらの正確な単語が現れた割合です。
必須キーワードは、同じ形の指定された制約の代理です。価格の節を含めよ、このフレーズは使うな。ヴォスは結果のスコアを上限と呼びます。モデルが一つのプロンプトで単語200件を追跡できなければ、より複雑な指示200件では苦戦するはずで、実際のより難しい規則はその数を上げるのではなく下げるはずです。それでも代理課題です。実在のスキルファイルの全数調査ではなく、エージェントが衝突するブランド・法務・ツール規則を推論したかのテストでもありません。
旧上限に対するヴォスの再現
新しいモデルを追う前に、良い科学は元のセットを再実行することだと彼は言います。モデルはすぐに生まれ、すぐに死にます。元のIFScaleモデル約10件のうち、彼の期間にAPIでまだ届いたのはGPT-4.1、Claude Sonnet 4、Gemini 2.5 Proだけだったと言います。研究を最初に公開したあと、その3件のうち1件が後に廃止され、構成はすでに2件に減っていました。可用性と廃止は、再試験期間における彼の主張として残します。Radarはカタログを確認していません。
精度対規則数の対数スケール図で、彼の曲線は論文とノイズの範囲内で一致したと言います。規則約500件までに、残ったモデルは制約の30–50%を欠いていました。1年前、最前線モデルは規則200–300件付近で崩れ始めていました。それらの数字はヴォスの再現結果です。Radarはベンチマークを再実行していません。
現行モデルが500件を通過したので壁を動かした
彼は同じ元のテストを、当時の最前線に向けました。GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro、DeepSeek V4 Proです。Opus 4.7を試したのは、彼によれば4.8が1週間後に出たからです。4件とも直ちに100%を出しました。旧ベンチマークは単語500件が上限で、モデルたちはその天井があることにも気づかず通過しました。
新しい壁を探すため、彼は条件を引き上げました。500から1,000、次いで2,000、そして10,000語のリストまで。拡張した対数スケールのチャートでは、新しい曲線は指定された制約およそ2,000件まで持ちこたえ、最良は約5,000件までだと言います。約12か月で同時指示追従がほぼ10倍、という話です。この拡張IFScale方式の実行から出た彼の見出し数字であり、Radarが検証した事実ではありません。
日常の体感と指標は食い違うことがあります。GPT-5.1からGPT-5.5への跳躍は体感では漸進的だったが、このスコアは大きく動いたと言います。Opus 4.8がすでにチャートをやや古くしたので、約6か月より古いスキルとプロンプト長の前提は作り直すべきだとも言います。この講演時点の助言であり、どの技術構成にも当てはまる不変の法則ではありません。
静かな忘却ではなく四つの失敗モード
予想外の結果は、新しいモデルがもはや主に規則を静かに落とす形では失敗しないことでした。4件それぞれが独自の仕方で失敗し、元の採点の物語を壊しました。
彼の実験では、DeepSeek 4が伝統的なケースです。規則約750件から忘れ始め、2,000件までにはほぼ半分を落とします。測定できるのでそのパターンを信頼します。彼のDeepSeek曲線であり、製品全体の順位ではありません。
Opus 4.7は無作為な単語の組み合わせを危険とみなし、APIで拒否しました。安全分類器が、anthraxとcyanideのような語が同じプロンプトに入ると降りると言います。語彙をOpenAIの安全フィルタに通したあとClaudeはよく働きましたが、医療やデュアルユースの内容では指示200–300件という早い段階で拒否し得ると言います。この無作為単語プロンプトで観察した振る舞いであり、一般的な安全評価ではありません。
Gemini 3.1 Proは5,000件まで強く、その後すべての規則を満たそうとして思考トークン予算を使い、必須語のない短い答えを返しました。同じ実行の逸話では、10,000トークンの予算が思考約9,500トークンと、必須語が一つもない500語の応答になりました。
GPT-5.5はチャート上で最も強く、規則5,000件まで精度約99%でした。さらに押すとレポートを始めたあと、愚かな依頼だとして作業を放棄しました。磨きのかかった半分の答えでも失敗に数えられ、最後まで読まなければ気づきにくいものです。
彼の分類です。DeepSeekは静かに忘れ、Claudeは拒否し、Geminiは考えすぎて沈黙し、GPT-5.5は仕事の一部を終えて残りを断ります。指示追従には、もはや一つに見分けられる失敗モードはありません。
| ヴォスの実行でのモデル | 失敗の仕方 | 曲線が折れた地点 |
|---|---|---|
| DeepSeek 4 | 必須語を静かに落とした | 規則約750件から忘却、2,000件までにはほぼ半分が欠落 |
| Claude Opus 4.7 | 安全分類器がAPIで拒否 | 無作為な単語の組み合わせが危険に見えた。医療・デュアルユースでは200–300件という早い拒否も観察 |
| Gemini 3.1 Pro | 思考予算を使い切ったあと短い答えを返した | 約5,000件まで持ちこたえたあと、考えすぎて必須語のない応答に |
| GPT-5.5 | 磨きのかかったレポートを始めたあと、愚かな依頼だとして降りた | 規則5,000件まで精度約99%。未完の答えは見逃しやすい |
スキルのワークフローで変わること
1年前、賢い手はスキルを指示約200件未満に抑え、残りをサブスキルの迷宮に分割することだったと彼は言います。いまはその圧縮は不要で、スキルファイルははるかに長くできると言います。用途が具体的な規則100件や300件を必要とするなら、モデルが一部を静かに無視したという古い不安なしに、一つのプロンプトに置けます。
彼のたとえでは、指定された制約2,000件は、1年前なら特化エージェントに分割していたはずのブランドと法務規則のスタイルガイド全体です。たとえであり、測定されたブランドガイド実験ではありません。
古い問いは、モデルが規則を保持できるかでした。新しい問いは、数千件の指示を詰め込むことが、より大きく遅く高いプロンプトに見合うかです。容量の壁は、コストと遅延の兼ね合いに変わりました。公開の価格表は出していません。コストは定性的なままです。
- スキルファイルは、もはや指示約200件未満とサブスキルの迷路に縛られる必要はありません。
- 彼の見方では、具体的な規則数百件は、古い静かな脱落の不安なしに一つのプロンプトに置けます。
- いま効いてくるのは容量の上限ではなく、コストと遅延です。
キーワードテストが証明しないこと
偽のレポートに無作為な単語を詰め込むのは、長いスキルがうまくいくかもしれないという証拠であり、うまくいくという証明ではありません。彼のセットではモデルは規則約750件から9,000件超までどこでも壁に当たるので、モデルの選択はいまも重要です。
テストは巨大なプロンプト上の明確な推論や、規則同士の衝突解消を測りません。指示2,000件、5,000件、あるいは10,000件を追跡することと、その上で推論することは同じではありません。
彼は後のChromaの研究(長い入力で精度が落ちる、いわゆる context rot)を、自身の要約どおりに引用します。モデル18件で、長い入力の精度はコンテキスト窓の上限よりかなり手前で30–50%落ち得て、一貫した構造化テキストのほうがシャッフルした指示より弱いです。報告書を完全には読んでいないと言いました。Radarには論文本文がないため、それらの数字はヴォスの再話として残します。
彼が引用する後の論文は、指示追従における言語モデルの信頼性を再検討する課題でモデル46件を試し、モデルがキーワード型ベンチマークを好成績でも、同じ指示を言い換えたり並べ替えたりすると崩れ得ることを見出しました。容量は上がり、信頼性はなお問題です。雑で実際の制約追従を測るより新しい試みとしてFirebench、CCR Bench、Guidebenchを挙げます。彼が触れた新興の関連研究であり、Radarのレビューではありません。
いま難しいのは検証
Claudeの拒否は大きなAPIエラーです。GPTの丁寧な未完のレポートは、最後まで読まなければ本物の答えに見えます。危険なのは沈黙の失敗です。
最前線モデルが厄介な本番タスクで静かに失敗し得るので、出力の監視が必要だと主張します。別のモデルが結果を確認することであり、彼はそれをevalと呼びます。この講演の監視助言であり、製品の順位付けではありません。実験コストの余談として、全クエリセットは7モデルにわたる約2,300回の呼び出しで$29かかったと言いました。公開API価格表ではありません。
締めくくりです。1年前、スキルを書く作業は、話の筋を保ったまま規則を収める圧縮の問題でした。その上限は彼の指標では約10倍動きました。いま難しいのは、モデルが言われたことを実際にしたかを確かめることであり、プロンプトを良くしても解けません。半年前に置いたプロンプトと指示の分量の前提は、もうずれているかもしれないので見直してください。コードとデータの画面上のGitHub URLを指しました。字幕はそのURLを読み上げていません。
出典
あわせて
資料と編集方針
AI EngineerのYouTubeアップロードの英語字幕全文(完全な録画、2026-09-13取得)。IFScale、Chroma、信頼性論文の公式本文は事前取得していません。性能、可用性、廃止、実験コストの主張はヴォスに帰属します。