원본 영상 보기

지시 200개가 불러온 불안

스킬 파일에 if-X-then-Y, 항상 Z를 포함하고, W는 절대 말하지 말라는 규칙을 잔뜩 넣었다면, 실무에서 드는 불안은 에이전트가 죽어서 멈추는 일이 아닙니다. 출력은 맞아 보이는데 그중 일부 규칙이 조용히 사라진다는 점입니다.

아라이즈 AI(Arize AI)의 개발자 관계 책임자이자 npm Inc. 공동 창업자인 로리 보스(Laurie Voss)는 지금은 AI 시스템을 어떻게 테스트할지에 시간을 씁니다. AI Engineer 유튜브 채널에 2026년 9월 9일 올라온 강연에서—컨퍼런스 세션 날짜는 녹화본에 없습니다—그는 그 불안의 출처를 곁말처럼 들은 숫자로 잡습니다. 몇 달 전 AI Engineer 마이애미에서 덱스터 호시(Dexter Horthy)가 에이전트는 지시를 약 200개까지 따르다 잊기 시작한다고, 그것도 2025년 수치라 이미 나아졌을지 모른다고 지나치듯 말했습니다. 그 강연은 스킬 파일이 주제가 아니었습니다. 보스는 그래도 듣기를 멈췄습니다. 200개는 지시로서 많지 않기 때문입니다.

실무에서 그가 보는 그림은, 괜찮은 스킬 파일이면 200개를 거의 바로 넘는다는 것입니다. 규칙은 하나씩 따로 셉니다. 사용자가 X라고 하면 Y를 하고, Z 절은 항상 넣고, 구절 W는 절대 쓰지 말 것. 모델이 200개 이후 조용히 추적을 멈추면, 그때부터는 더 복잡한 스킬을 쌓을 수 없습니다. 연구가 겨냥하는 것은, 톤·형식·예외를 여러 장 넘기고 그럴듯한 결과를 받았을 때, 에이전트가 파일을 따랐는지 비슷한 모사품을 돌려줬는지 알 수 없다는 그 느낌입니다.

200의 출처, 그리고 키워드가 상한인 이유

보스는 200이라는 숫자가 속설이 아니라고 말합니다. 그는 이를 전년의 IFScale 벤치마크 논문으로 추적합니다. 저자 이름은 “제로슬로위치(Jeroslowitch)”로 발음하고, 공동 저자가 있습니다. Radar는 그 논문을 가져오지 않았으므로 활자 표기는 여기서 복원하지 않습니다.

그가 설명하는 절차는 단순합니다. 모델에 사업 보고서를 쓰라고 하고, 반드시 등장해야 하는 정확한 단어 목록을 점점 늘립니다. customer, revenue 같은 식입니다. 필수 단어 하나가 지시 하나입니다. 밀도 n은 쌓아 올린 규칙 수이고, 정확도는 그 정확한 단어가 나타난 비율입니다.

필수 키워드는 같은 모양의 명시된 제약을 대리합니다. 가격 절을 포함하라, 이 구절은 쓰지 마라. 보스는 그 점수를 상한이라고 부릅니다. 모델이 한 프롬프트에서 단어 200개를 추적하지 못하면, 더 복잡한 지시 200개에서는 더 힘들 것이고, 실제의 더 어려운 규칙은 숫자를 올리기보다 내려야 합니다. 그래도 대리 과제입니다. 실제 스킬 파일의 전수도 아니고, 에이전트가 서로 충돌하는 브랜드·법률·도구 규칙을 추론했는지를 보는 테스트도 아닙니다.

옛 상한에 대한 보스의 재현

새 모델을 쫓기 전에, 좋은 과학은 원래 세트를 다시 돌리는 일이라고 그는 말합니다. 모델은 빨리 살아나고 빨리 죽습니다. 원래 IFScale 모델 약 10개 중, 그의 기간에 API로 아직 닿을 수 있던 것은 GPT-4.1, Claude Sonnet 4, Gemini 2.5 Pro뿐이었다고 합니다. 연구를 처음 공개한 뒤 그중 하나가 나중에 단종되어 구성은 이미 두 개로 줄었습니다. 가용성과 단종은 그의 재시험 기간 주장으로 남깁니다. Radar는 카탈로그를 확인하지 않았습니다.

정확도 대 규칙 수의 로그 스케일 그래프에서, 그의 곡선은 논문과 노이즈 범위 안에서 맞았다고 합니다. 규칙 약 500개쯤이면 남은 모델은 제약의 30–50%를 놓치고 있었습니다. 1년 전 최전선 모델은 규칙 200–300개 부근에서 무너지기 시작했습니다. 그 숫자는 보스의 재현 결과입니다. Radar는 벤치마크를 다시 돌리지 않았습니다.

현행 모델이 500개를 통과하자 벽을 옮기다

그는 이어서 같은 원래 테스트를 당시 최전선에 겨눴습니다. GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro, DeepSeek V4 Pro입니다. Opus 4.7을 시험한 이유는, 그가 말하길, 4.8이 일주일 뒤에 나왔기 때문입니다. 네 모델 모두 즉시 100%를 냈습니다. 옛 벤치마크는 단어 500개에서 끝났고, 모델들은 그 상한이 있는지도 모른 채 통과했습니다.

새 벽을 찾기 위해 그는 목표를 바꿨습니다. 500에서 1,000, 다시 2,000, 그리고 10,000단어 목록까지. 확장된 로그 스케일 차트에서, 그는 더 새로운 곡선이 명시된 제약 대략 2,000개까지 버티고, 최선은 약 5,000개까지라고 말합니다. 약 12개월 만에 동시 지시 수행이 거의 10배라는 이야기입니다. 확장된 IFScale 방식 실행에서 나온 그가 내세운 숫자이지, Radar가 검증한 사실이 아닙니다.

일상적인 체감과 지표는 어긋날 수 있습니다. GPT-5.1에서 GPT-5.5로의 점프는 체감상 점진적이었지만 이 점수는 많이 움직였다고 합니다. Opus 4.8이 이미 차트를 약간 낡게 만들었으니, 약 6개월보다 오래된 스킬·프롬프트 길이 가정은 다시 설계해야 한다고도 말합니다. 이 강연 시점의 조언이지, 모든 구성에 늘 적용되는 법칙은 아닙니다.

조용한 망각 대신 네 가지 실패 모드

예상 밖 결과는, 새 모델이 더 이상 주로 규칙을 조용히 떨어뜨리며 실패하지 않는다는 점이었습니다. 네 모델 각각이 독특한 방식으로 실패했고, 원래 채점 이야기를 깨뜨렸습니다.

그의 실험에서 DeepSeek 4는 전통적인 경우입니다. 규칙 약 750개부터 잊기 시작하고, 2,000개쯤이면 거의 절반을 떨어뜨립니다. 그는 그 패턴을 측정 가능해서 신뢰합니다. DeepSeek에 대한 그의 곡선이지, 제품 전반의 순위가 아닙니다.

Opus 4.7은 무작위 단어 조합을 위험으로 보고 API에서 거부했습니다. 안전 분류기가 anthrax와 cyanide 같은 단어가 같은 프롬프트에 있으면 빠져나간다고 합니다. OpenAI 안전 필터로 어휘를 걸러낸 뒤에는 Claude가 잘 수행했지만, 의료나 이중 용도 내용에서는 지시 200–300개만큼 일찍 거부할 수 있다고 합니다. 이 무작위 단어 프롬프트에서 그가 본 행동이지, 일반 안전 평가가 아닙니다.

Gemini 3.1 Pro는 5,000개까지 강했고, 그다음 모든 규칙을 맞추려 사고 토큰 예산을 다 쓰고 필수 단어가 빠진 짧은 답을 돌려줬습니다. 같은 실험의 일화에서, 10,000토큰 예산이 사고에 약 9,500토큰, 필수 용어가 하나도 없는 500단어 응답이 되었습니다.

GPT-5.5는 차트에서 가장 강해 규칙 5,000개까지 정확도 약 99%였습니다. 더 밀면 보고서를 시작하다 어리석은 요청이라며 작업을 포기했습니다. 다듬어진 반쪽 답도 실패로 세어지고, 끝까지 읽지 않으면 알아채기 어렵습니다.

그의 분류: DeepSeek는 조용히 잊고, Claude는 거부하고, Gemini는 과잉 사고로 침묵하고, GPT-5.5는 일을 일부 끝내고 나머지는 거절합니다. 지시 수행에는 더 이상 알아보기 쉬운 실패 모드가 하나가 아닙니다.

당시 최전선 모델 네 개가 보스의 키워드 포함 테스트에서 어떻게 실패했는지, 그가 보고한 대로입니다. Radar는 벤치마크를 재실행하지 않았습니다.
보스 실험의 모델실패 방식곡선이 꺾인 지점
DeepSeek 4필수 단어를 조용히 떨어뜨림규칙 약 750개부터 망각, 2,000개쯤이면 거의 절반 누락
Claude Opus 4.7안전 분류기가 API에서 거부무작위 단어 조합이 위험해 보임. 의료·이중 용도 내용에서는 200–300개만큼 이른 거절도 봄
Gemini 3.1 Pro사고 예산을 다 쓴 뒤 짧은 답을 반환약 5,000개까지 버틴 뒤, 과잉 사고로 필수 단어가 빠진 응답
GPT-5.5다듬어진 보고서를 시작하다 어리석은 요청이라며 중단규칙 5,000개까지 정확도 약 99%. 반쪽 답은 놓치기 쉬움

스킬 워크플로에서 달라지는 점

1년 전만 해도, 영리한 수는 스킬을 지시 약 200개 아래로 두고 나머지를 하위 스킬로 잘게 쪼개는 일이었다고 합니다. 지금은 그 압축이 더는 필수가 아니고 스킬 파일은 훨씬 길어질 수 있다고 말합니다. 쓰임새에 구체적인 규칙 100개나 300개가 필요하면, 모델이 일부를 조용히 무시했다는 옛 불안 없이 한 프롬프트에 넣을 수 있습니다.

그의 비유에서 명시된 제약 2,000개는, 1년 전이면 특화 에이전트에 쪼갰을 브랜드·법률 규칙의 스타일 가이드 전체입니다. 비유이지, 측정된 브랜드 가이드 실험이 아닙니다.

예전 질문은 모델이 규칙을 붙잡을 수 있느냐였습니다. 이제 질문은 지시 수천 개를 넣는 것이 더 크고 느리고 비싼 프롬프트 값을 하느냐입니다. 용량이 모자라 막히던 문제는, 비용과 지연을 얼마나 감수할지 고르는 문제로 바뀌었습니다. 공개 가격표는 내놓지 않습니다. 비용은 정성적으로만 남습니다.

  • 스킬 파일을 지시 약 200개 아래로 자르고, 나머지를 하위 스킬로 잘게 나눌 필요는 더 이상 없습니다.
  • 보스가 보기에, 구체적인 규칙 수백 개는 한 프롬프트에 넣어도 됩니다. 모델이 일부를 조용히 빠뜨리던 예전 걱정은 전제가 아닙니다.
  • 이제는 용량이 바닥나서 막히는 것이 아니라, 비용과 지연을 얼마나 감수할지가 한도입니다.

키워드 테스트가 증명하지 않는 것

가짜 보고서에 무작위 단어를 넣는 일은 긴 스킬이 될 수 있다는 증거이지, 된다는 증명이 아닙니다. 그의 세트에서 모델은 규칙 약 750개에서 9,000개 넘는 지점까지 어디서든 벽에 부딪히므로, 모델 선택은 여전히 중요합니다.

테스트는 거대한 프롬프트 위에서의 분명한 추론이나, 규칙 사이의 충돌 해소를 측정하지 않습니다. 지시 2,000개, 5,000개, 어쩌면 10,000개를 추적하는 것과 그 위를 추론하는 것은 다릅니다.

그는 이후 Chroma가 긴 입력에서 정확도가 떨어지는 현상을 다룬 연구를, 자신이 요약한 대로 인용합니다. 모델 18개에서 긴 입력 정확도는 컨텍스트 창 한도보다 훨씬 앞에서 30–50% 떨어질 수 있고, 일관된 구조화 텍스트가 뒤섞인 지시보다 더 취약합니다. 보고서를 완전히 읽지는 않았다고 했습니다. Radar에는 논문 본문이 없으므로 그 숫자는 보스의 재진술로 남깁니다.

그가 인용하는 이후 논문은, 지시 수행에서 언어 모델 신뢰성을 다시 보는 과제로 모델 46개를 시험했고, 모델이 키워드 스타일 벤치마크를 잘 치르고도 같은 지시를 다시 쓰거나 순서를 바꾸면 무너질 수 있음을 찾았습니다. 용량은 올라갔고, 신뢰성은 여전히 문제입니다. 지저분한 실제 제약 수행을 재려는 더 새로운 시도로 Firebench, CCR Bench, Guidebench를 이름 붙입니다. 그가 언급한 떠오르는 관련 연구이지, Radar의 리뷰가 아닙니다.

이제 어려운 부분은 검증

Claude의 거부는 큰 API 오류입니다. GPT의 공손한 반쪽 보고서는 끝까지 읽지 않으면 진짜 답처럼 보입니다. 위험한 것은 침묵 실패입니다.

최전선 모델이 까다로운 프로덕션 과제에서 조용히 실패할 수 있으므로, 출력 모니터링이 필요하다고 주장합니다. 다른 모델이 결과를 확인하는 일이고, 그는 이를 eval이라고 부릅니다. 이 강연의 모니터링 조언이지 제품 순위가 아닙니다. 실험 비용 곁말로, 전체 질의 세트가 모델 7개에 걸쳐 약 2,300회 호출에 $29가 들었다고 했습니다. 공개 API 가격표가 아닙니다.

맺음: 1년 전 스킬을 쓰는 일은 줄거리를 잃지 않고 규칙을 맞추는 압축 문제였습니다. 그 상한은 그의 지표에서 약 10배 움직였습니다. 이제 어려운 부분은 모델이 시킨 일을 실제로 했는지를 검증하는 것이고, 더 나은 프롬프트가 해결하지 않습니다. 6개월 전의 프롬프트·지시 크기 가정은 이미 틀렸을 수 있으니 다시 보십시오. 코드와 데이터의 화면 속 GitHub URL을 가리켰습니다. 자막은 그 URL을 말하지 않습니다.

출처

AI Engineer · @aiDotEngineer

함께 본 출처

자료 및 작성 기준

AI Engineer 유튜브 업로드의 영어 자막 전문(완전한 녹화본, 2026-09-13 입수). IFScale, Chroma, 신뢰성 논문의 공식 본문은 미리 가져오지 않았습니다. 성능, 가용성, 단종, 실험 비용 주장은 보스에게 귀속합니다.