200 条指令带来的担忧
如果技能文件里堆满了 if-X-then-Y、必须包含 Z、绝对不要说 W 这类规则,真正让人担心的不是智能体崩溃,而是输出看起来没问题,其中一部分规则却悄悄消失了。
Arize AI 开发者关系负责人、npm Inc. 联合创始人劳里·沃斯(Laurie Voss)如今把时间花在如何测试 AI 系统上。这段演讲于 2026 年 9 月 9 日上传到 AI Engineer 的 YouTube 频道——会议场次日期录音里没有——他把这种焦虑定位到一个他当作旁白听到的数字。几个月前,在 AI Engineer Miami,德克斯特·霍西(Dexter Horthy)随口提到,智能体大约能遵循 200 条指令后就开始遗忘,而且那是 2025 年的数字,可能已经更好了。那场演讲并不是关于技能文件的。沃斯还是听不下去了,因为 200 条指令并不算多。
按他的现场经验,像样的技能文件几乎立刻就会超过 200 条。每条独立规则分开计数:用户说 X 就做 Y;必须包含关于 Z 的一节;永远不要用短语 W。如果模型在 200 条之后悄悄停止跟踪,你就没法再往上堆更复杂的技能。这项研究针对的是那种感觉:你交出好几页语气、格式和边界情况,得到一个像样的结果,却分不清智能体是遵守了文件,还是交回了一个近似的仿制品。
200 从何而来,以及关键词为何是上限
沃斯说,200 这个数字不是民间传说。他把它追溯到前一年的 IFScale 基准论文,作者名字他读成 “Jeroslowitch”,另有共同作者。Radar 没有抓取该论文,因此这里不还原印刷拼写。
按他的描述,流程很简单。让模型写一份商业报告。给它一份必须出现的精确单词清单,并不断加长——customer、revenue 等等。每个必现词就是一条指令。密度 n 是你堆上去的规则数;准确率是这些精确单词出现了多少。
必现关键词是同一形状指定约束的代理:包含定价一节,或永远不要用这个短语。沃斯把所得分数称为上限。如果模型无法在一条提示里跟踪 200 个词,它会更难应付 200 条更复杂的指令;更难的真实规则应当把数字压低,而不是抬高。这仍然是代理任务。它不是真实技能文件的普查,也不是在测智能体是否对冲突的品牌、法律和工具规则做了推理。
沃斯对旧上限的复现
他说,在追新模型之前,好的科学意味着重跑原来的集合。模型生得快、死得也快。大约十个原始 IFScale 模型里,他说在他的窗口内仍能通过 API 用到的只有 GPT-4.1、Claude Sonnet 4 和 Gemini 2.5 Pro。他首次发表这项研究之后,三者之一后来被停用,阵容已经只剩两个。可用性和停用仍作为他复测窗口内的主张;Radar 没有核对目录。
在准确率对规则数的对数坐标图上,他说自己的曲线与论文在噪声范围内吻合。到大约 500 条规则时,剩下的模型漏掉了 30–50% 的约束。一年前,前沿模型在大约 200–300 条规则处开始崩溃。这些数字是沃斯的复现结果。Radar 没有重跑该基准。
现行模型走过了 500,于是他把墙往后推
他随后把同一套原始测试对准当时的前沿:GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro 和 DeepSeek V4 Pro。他测 Opus 4.7,是因为据他说 4.8 一周后才发布。四个模型立刻都拿到 100%。旧基准在 500 个词封顶,模型走过那道上限,甚至没察觉它在那里。
为了找到新的墙,他抬高了条件:从 500 到 1,000,再到 2,000,一直到 10,000 词的清单。在扩展后的对数坐标图上,他说较新的曲线大约撑到 2,000 条指定约束,最好的大约到 5,000——大约十二个月内,同时遵循指令接近 10 倍。那是这次扩展 IFScale 风格实验里他抛出的头条数字,不是 Radar 验证过的事实。
日常体感和指标可能对不上。他说从 GPT-5.1 到 GPT-5.5 的跃升体感是渐进的,但这个分数动得很大。他还说 Opus 4.8 已经让这张图略显过时,因此大约六个月以上的技能和提示长度假设应当重新设计。这是这场演讲当时的建议,不是对每套技术栈都永远成立的规律。
四种失败模式,而不只是悄悄遗忘
出人意料的结果是,新模型不再主要以悄悄丢掉规则的方式失败。四个模型各自以独特方式失败,打破了原来的计分故事。
在他的实验里,DeepSeek 4 是传统情形:大约 750 条规则开始遗忘,到 2,000 条时丢掉将近一半。他信任这个模式,因为它可测量。这是他的 DeepSeek 曲线,不是全产品排名。
Opus 4.7 把随机词组合当成危险,并在 API 层拒绝。他说安全分类器会在 anthrax 和 cyanide 这类词落进同一条提示时退出。他把词表过了一遍 OpenAI 安全过滤器之后,Claude 表现很好——但他表示,在医疗或两用内容上,它可以早在 200–300 条指令就拒绝。这是他在这条随机词提示上观察到的行为,不是一般安全评估。
Gemini 3.1 Pro 一直强到 5,000,然后把思考 token 预算花在试图满足每条规则上,返回一篇缺少必现词的短答案。同一次实验的一则轶事里,10,000 token 预算变成大约 9,500 token 的思考,外加一篇 500 词、一个必现术语都没有的回复。
GPT-5.5 在图上最强,到 5,000 条规则准确率约 99%。再往上推,它开始写报告,然后把任务当成愚蠢请求放弃——一篇打磨过的半成品答案仍算失败,除非读到结尾否则很难察觉。
他的分类:DeepSeek 悄悄遗忘,Claude 拒绝,Gemini 想过头陷入沉默,GPT-5.5 做完一部分再拒绝其余。指令遵循不再只有一种认得出来的失败模式。
| 沃斯实验中的模型 | 如何失败 | 曲线在何处折断 |
|---|---|---|
| DeepSeek 4 | 悄悄丢掉必现词 | 约 750 条规则开始遗忘;到 2,000 条时将近一半缺失 |
| Claude Opus 4.7 | 安全分类器在 API 拒绝 | 随机词组合看起来危险;在医疗或两用内容上他也看到早在 200–300 条就拒绝 |
| Gemini 3.1 Pro | 花光思考预算,然后返回短答案 | 撑到约 5,000,然后想过头,回复里缺少必现词 |
| GPT-5.5 | 开始一篇打磨过的报告,再以愚蠢请求为由退出 | 到 5,000 条规则约 99% 准确率;半成品答案容易漏看 |
这会怎样改变技能工作流
他说,一年前聪明的做法是把技能压在大约 200 条指令以下,把其余拆进子技能迷宫。他现在说那种压缩不再必要,技能文件可以长得多。如果一个用例需要 100 或 300 条具体规则,它们可以放在一条提示里,而不必再担心模型悄悄忽略其中一部分。
在他的比喻里,2,000 条指定约束等于一整本品牌和法律规则的风格指南,一年前本会拆给专门化智能体。那是类比,不是测过的品牌指南实验。
过去的问题是模型能不能抓住这些规则。现在的问题是,塞进数千条指令是否值得一条更大、更慢、更贵的提示。容量上的死限变成了成本和延迟的取舍。他没有给出公开价目;成本仍是定性的。
- 技能文件不必再困在大约 200 条指令以下,再配上一迷宫子技能。
- 在他看来,几百条具体规则可以放在一条提示里,而不必再有过去那种悄悄丢规则的焦虑。
- 现在真正卡人的是成本和延迟,不是容量到了顶。
关键词测试证明不了什么
把随机词塞进一份假报告,是长技能可能管用的证据,不是它们确实管用的证明。他那一组模型撞墙的位置从大约 750 条到 9,000 条以上都有,所以模型选择仍然重要。
测试并不衡量在巨型提示上的清晰推理,也不衡量规则之间的冲突消解。跟踪 2,000、5,000,乃至可能 10,000 条指令,并不等于在它们之上做推理。
他按自己的概括引用了 Chroma 后来的 context-rot 研究:在 18 个模型上,长输入准确率可以在远未到上下文窗口上限时下降 30–50%,连贯的结构化文本比打乱的指令更脆弱。他说自己尚未通读该报告。Radar 没有论文正文,因此那些数字仍作为沃斯的转述。
他引用的后续论文测试了 46 个模型,重访语言模型在指令遵循上的可靠性,发现模型可以在关键词风格基准上拿高分,却在同一批指令被改写或重排时崩溃。容量上去了;可靠性仍是问题。他把 Firebench、CCR Bench 和 Guidebench 列为衡量杂乱真实约束遵循的较新尝试。那是他提到的新兴相关工作,不是 Radar 的评测。
现在难的是验证
Claude 的拒绝是响亮的 API 错误。GPT 那份客气的半成品报告,除非读到结尾,否则看起来像真正的答案。危险的是沉默失败。
因为前沿模型可能在棘手的生产任务上静默失败,他主张需要输出监控——用另一个模型检查结果,他称之为 eval。这是这场演讲里的监控建议,不是产品排名。作为实验成本旁白,他说完整查询集在七个模型上大约 2,300 次调用花了 $29;那不是公开 API 价目。
他的收尾:一年前写技能是压缩问题,要把规则塞进去又不丢主线。那道上限在他的指标上大约动了 10 倍。现在难的是验证模型是否真的做了被告知的事,更好的提示解决不了这一点。重新审视六个月前的提示和指令规模假设,因为它们可能已经错了。他指向屏幕上的 GitHub URL 作为代码和数据;字幕没有读出该 URL。
来源
相关来源
资料与编写依据
AI Engineer YouTube 上传的完整英文字幕(完整录像,2026-09-13 取得)。未预先抓取 IFScale、Chroma 或可靠性论文的正式正文。性能、可用性、停用和实验成本主张仍归属于沃斯。