Docs | Src |  A-  |  A*  |  A+  | -/-

Metadata
sourcehttps://arxiv.org/html/2604.09791v1
created2026-05-01
byopenai:gpt-5.4
style번호식
# (요약) Pioneer Agent Continual Improvement of Small Language Models in Production ## Abstract 1. 소형 언어 모델(SLM)은 낮은 비용, 빠른 추론, 쉬운 특화 가능성 때문에 프로덕션 배포에 매력적임. 2. 그러나 특정 작업에 맞게 적응시키는 과정은 여전히 어려운 엔지니어링 루프임. 3. 핵심 난점은 학습 자체보다 데이터 큐레이션, 실패 진단, 회귀 방지, 반복 제어 같은 주변 의사결정에 있음. 4. 저자들은 이 전체 생애주기를 자동화하는 폐쇄 루프 시스템인 Pioneer Agent를 제안함. 5. 콜드스타트 모드에서는 자연어 작업 설명만 주어지면 에이전트가 데이터를 수집하고 평가 세트를 만들며 데이터, 하이퍼파라미터, 학습 전략을 함께 최적화하면서 모델을 반복 학습함. 6. 프로덕션 모드에서는 이미 배포된 모델과 라벨된 실패 사례가 주어지면 에이전트가 오류 패턴을 진단하고 표적 학습 데이터를 만들며 명시적 회귀 제약 아래 재학습함. 7. 저자들은 전체 적응 루프를 평가하기 위해 점진적으로 노이즈가 증가하는 합성 추론 로그 벤치마크 AdaptFT-Bench를 도입함. 8. AdaptFT-Bench는 진단, 커리큘럼 합성, 재학습, 검증까지 전체 적응 루프를 시험하도록 설계됨. 9. 추론, 수학, 코드 생성, 요약, 분류를 포함한 8개 콜드스타트 벤치마크에서 Pioneer Agent는 기본 모델 대비 1.6–83.8점 향상됨. 10. AdaptFT-Bench에서는 7개 모든 시나리오에서 성능을 개선하거나 유지함. 11. 반면 단순 재학습(naive retraining)은 최대 43점까지 성능이 하락함. 12. 공개 벤치마크 과제로 구성한 두 개의 프로덕션형 배포 시나리오에서 의도 분류(intent classification)는 84.9%에서 99.3%로 향상됨. 13. 같은 설정에서 엔터티 F1은 0.345에서 0.810으로 향상됨. 14. 성능 향상 외에도 에이전트는 다운스트림 피드백만으로 연쇄적 사고 감독(chain-of-thought supervision), 작업 특화 최적화, 품질 중심 데이터 큐레이션 같은 효과적인 학습 전략을 자주 발견함. ## 1 Introduction 15. 프런티어 대형 언어 모델(LLM)은 강력한 범용 시스템임. 16. 그러나 이런 모델은 대규모 배포와 운영에 비용이 너무 높을 때가 많음. 17. 또한 소형 모델에 비해 추론 지연시간이 클 수 있음. 18. 실제 현장에서는 의도 분류(intent classification), 엔터티 추출(entity extraction), 요약(summarization), 구조화 생성(structured generation) 같은 구체적 작업 하나에 특화된 훨씬 작은 모델을 원하는 경우가 많음. 19. 1B–8B 파라미터 범위의 소형 언어 모델(SLM)은 이런 이유로 매력적임. 20. 문제는 소형 모델을 특정 작업에서 잘 동작하게 만드는 과정이 여전히 어려운 엔지니어링 루프라는 점임. 21. 이 과정에서는 어떤 데이터를 수집할지, 어떤 기본 모델과 학습 레시피를 쓸지, 진행 상황을 어떻게 평가할지, 어떤 실패가 중요한지, 언제 반복을 멈출지 결정해야 함. 22. 이런 결정은 AutoML과 신경 아키텍처 최적화에서 다뤄온 더 넓은 문제와 연결됨. 23. 이 루프는 하이퍼파라미터 튜닝을 넘어섬. 24. 실제 배포에서는 학습 이전 단계의 문제가 핵심임. 25. 여기에는 작업을 정확히 정의하기, 감독 신호 구성과 정제, 경계 사례 식별, 진짜 실패와 라벨 오류 구분, 알려진 약점을 고치면서 회귀를 피하기가 포함됨. 26. 개선은 단조롭지 않을 수 있음. 27. 모델은 한 슬라이스에서는 개선되지만 다른 슬라이스에서는 악화될 수 있음. 28. 더 큰 데이터셋이 더 작지만 더 고품질인 데이터셋보다 성능이 낮을 수도 있음. 29. 심지어 프롬프트 형식 문제도 모델링 실패처럼 보일 수 있음. 30. 소형 모델에서는 이런 결정이 최종 성능을 좌우하는 경우가 많음. 31. 기존 연구는 이 문제의 중요한 일부를 다루지만 전체 루프는 다루지 못함. 32. 일부 연구는 소형 LLM을 위한 효과적 지도 미세조정 설정을 규명했지만 실제 적용에는 여전히 많은 수작업 반복이 필요함. 33. AutoML 시스템은 사전정의된 공간에서 하이퍼파라미터 선택을 자동화함. 34. 데이터 중심 방법은 라벨 품질과 반복적 데이터 개선에 집중함. 35. 프롬프트 및 LM 프로그램 최적화기는 모델 가중치가 아니라 고정 모델의 인터페이스를 조정함. 36. 에이전트 측면에서는 실행 기반 탐색이 GPU 커널 최적화와 과학 발견에 효과적임이 입증됨. 37. ML 엔지니어링 벤치마크와 자율 미세조정 환경은 LLM 에이전트가 ML 워크플로의 상당 부분을 수행할 수 있음을 보여줌. 38. 그러나 이런 시스템은 주로 오프라인 최적화를 다룸. 39. 또한 실제 추론 실패에서 시작해 무엇이 학습으로 고쳐질 수 있는지 판단하고, 표적 감독 데이터를 만들고, 재학습하고, 개선이 회귀를 유발하지 않았는지 검증하는 프로덕션 적응 문제를 중심에 두지 않음. 40. 그림 1은 Pioneer Agent 시스템 아키텍처를 보여줌. 41. 오케스트레이터 LLM인 Claude Sonnet 4.6이 LangGraph 상태 머신을 구동하며 작업 분석, 데이터 큐레이션, 학습, 평가를 조정함. 42. 콜드스타트 모드는 작업 설명에서 시작함. 43. 프로덕션 모드는 판정된 추론 추적(judged inference traces)을 사용함. 44. 두 모드 모두 학습 파이프라인 π=(D,H,S)에 대한 에이전트 유도 반복 탐색을 공유함. 45. ARC-Challenge 같은 일부 실행에서는 그래프 구조의 Monte Carlo Graph Search(MCGS)를 사용함. 46. 이 탐색은 Modal 샌드박스에서 Tinker SDK를 사용해 실행됨. 47. 이 논문은 위 설정을 직접 다룸. 48. 저자들은 SLM 자동 적응을 위한 폐쇄 루프 시스템 Pioneer Agent를 제시함. 49. 시스템은 두 가지 모드로 동작함. 50. 콜드스타트 모드에서는 입력이 자연어 작업 설명뿐임. 51. 이때 에이전트는 작업 조사, 실제 데이터셋 식별 및 다운로드, 필요시 합성 데이터 보강, 학습 전 홀드아웃 검증 세트 구축, 구조화된 지침 기반 감독 큐레이션, 병렬 다중 설정 학습, 홀드아웃 검증 세트 기준 반복을 통해 처음부터 미세조정 모델을 구축함. 52. 여기서 구조화된 지침의 예로는 hard negatives, 라벨 균형, 문맥 길이 맞춤이 포함됨. 53. 프로덕션 모드에서는 입력이 배포된 모델과 판정된 추론 실패 사례임. 54. 이 실패 판정은 LLM-as-judge 또는 사람 검토에서 올 수 있음. 55. 이 모드에서 에이전트는 프로덕션 추적을 조회하고, 실패 분류 체계(failure taxonomy)를 만들고, 표적 프로빙으로 약점을 확인하고, 수정 예시·hard negatives·replay data를 포함하는 교정 학습 커리큘럼을 합성하고, 모델을 재학습하며, 실패 세트와 회귀 세트 둘 다에서 평가하고, 기존 동작을 악화시키지 않으면서 실패가 해결될 때까지 반복함. 56. Pioneer Agent의 탐색 공간은 모델 하이퍼파라미터만 포함하지 않음. 57. 에이전트는 학습 데이터 구성, 하이퍼파라미터 설정, 학습 전략을 공동으로 탐색함. 58. 저자들은 이 탐색을 에이전트 유도 반복 탐색으로 구현함. 59. 선택된 실행에서는 ARC-Challenge 사례처럼 MCGS 형태를 사용함. 60. 각 노드는 완전한 학습 시도와 그 측정된 결과에 대응함. 61. 이를 통해 에이전트는 개별 시도가 아니라 실험 궤적 전체를 추론할 수 있음. 62. 또한 데이터 문제와 최적화 문제를 구별할 수 있음. 63. 서로 다른 탐색 가지에서 발견된 유용한 전략을 결합할 수도 있음. 64. 그림 2는 콜드스타트 성능에서 기준 모델과 Pioneer Agent를 비교함. 65. 각 막대 쌍은 기본 모델 점수와 Pioneer Agent 학습 후 점수를 작업별 지표로 비교함. 66. 지표는 accuracy, F1, pass@1, ROUGE-2를 포함함. 67. 결과는 세 모델 계열인 Llama 3B, Qwen 8B, GLiNER2에 걸쳐 있음. 68. 작업 범주는 추론(ARC, TriviaQA, GSM8K), 분류(SMS Spam), 코드 생성(HumanEval), 요약(XSum, SAMSum)을 포함함. 69. 프로덕션 설정에서는 무엇을 개선으로 볼지가 달라짐. 70. 오프라인 벤치마크 향상만으로는 충분하지 않음. 71. 효과적 적응 시스템은 노이즈 많고 이질적인 실패 신호를 다뤄야 함. 72. 또한 오류가 데이터 문제, 모델 한계, 라벨 노이즈 중 어디서 오는지 식별해야 함. 73. 그리고 이전에 맞았던 동작에 대한 회귀 제약을 만족해야 함. 74. Pioneer Agent는 이 요구를 충족하도록 설계됨. 75. 저자들의 기여는 다음과 같음. 76. 첫째, 자연어 작업 설명에서의 콜드스타트 부트스트래핑과 관측된 실패에서의 프로덕션 시점 개선을 모두 지원하는 SLM 자동 적응용 폐쇄 루프 시스템 Pioneer Agent를 제시함. 77. 둘째, 실패 분류 체계 구축, 표적 프로빙 기반 약점 확인, 구조화된 데이터셋 구성(수정 예시, hard negatives, replay data)을 활용해 프로덕션 추론 실패로부터 학습 데이터를 구성하는 실패 주도 커리큘럼 합성 방법을 제안함. 78. 셋째, 실패 진단, 커리큘럼 합성, 재학습, 회귀 검증의 전체 루프 전반에서 자율 모델 개선을 평가하는 합성 추론 로그 기반 벤치마크 AdaptFT-Bench를 도입함. 79. 넷째, 8개 콜드스타트 벤치마크와 여러 프로덕션 시나리오에서 수학, 코딩, 요약, 분류 작업 전반에 걸쳐 큰 향상을 보임. 80. 다섯째, 에이전트가 연쇄적 사고 학습(chain-of-thought training), 작업별 epoch 민감도, 양보다 질 중심 데이터 큐레이션, 시스템 프롬프트 엔지니어링 같은 효과적 미세조정 전략을 명시적 지시 없이도 성능 피드백만으로 일관되게 선택함을 보임. ## 2 Pioneer Agent ### 2.1 Architecture 81. Pioneer Agent는 Claude Sonnet 4.6을 오케스트레이터로 사용하는 LangGraph 상태 머신 위에 구축됨. 82. Claude Sonnet 4.6은 extended thinking과 32K 토큰 예산, 1M 토큰 컨텍스트 윈도를 사용함. 83. 에이전트는 16GB 메모리와 최대 24시간 타임아웃을 가진 격리 컨테이너인 Modal 샌드박스에서 실행됨. 84. 또한 데이터 조작, 모델 학습, 평가를 위한 도구 모음에 접근함. 85. 시스템은 인코더 기반과 디코더 기반 아키텍처에 대응하는 두 모델 계열을 지원함. 86. 두 계열은 분류, 추출, 생성 작업을 함께 포괄함. 87. 디코더 학습은 Tinker SDK를 통해 수행됨. 88. Tinker SDK는 LoRA(Low-Rank Adaptation) 미세조정과 결과 모델에 대한 즉시 추론을 제공함. 89. 인코더 학습(GLiNER2)은 더 작은 인코더 구조 덕분에 전체 미세조정과 LoRA 둘 다 지원함. 90. 에이전트는 데이터셋 관리, 학습 오케스트레이션, 추론을 위한 사전 로드된 helper 함수 집합 tinker_helpers.py와 상호작용함. 91. 에이전트는 컨텍스트 관리와 병렬 작업을 위해 계층적 구조를 사용함. 92. 메인 에이전트는 전체 파이프라인을 최대 500회(프로덕션) 또는 1,500회(콜드스타트) LangGraph 턴 동안 조정함. 93. 각 턴은 하나의 LLM 추론 단계와 관련 도구 호출을 의미함. 94. 특화된 Trace Analyzer 하위 에이전트는 약 100K 출력 토큰 한도로 데이터 집약적 SQL 분석을 처리함. 95. 독립 하위 에이전트는 delegate_task를 통해 병렬 작업용으로 생성될 수 있음. 96. 예시로 학습 작업이 도는 동안 다음 데이터셋 구축을 병렬 수행할 수 있음. 97. 독점적인 Context Manager 모듈은 대화 상태를 모니터링하고 수백 턴 동안 이전 결정을 잃지 않게 보장함. 98. 대화가 컨텍스트 한계에 가까워지면 이 모듈은 핵심 결정, 평가 결과, 데이터셋 계보를 보존하면서 오래된 턴을 선택적으로 압축함. 99. Context Manager의 내부 메커니즘은 논문에서 공개하지 않음. 100. 에이전트는 data-curation.md라는 지속 로그도 유지함. 101. 이 구조화된 마크다운 파일에는 데이터셋 버전, 구성 비율, 품질 관리 결정, 반복별 평가 결과가 기록됨. 102. 이 파일은 디스크에 기록되어 압축 사이클 이후에도 유지됨. 103. 따라서 에이전트는 언제든 이 파일을 다시 읽어 내구성 있는 provenance를 확보할 수 있음. ### 2.2 Search Procedure 104. 저자들은 자율 미세조정을 데이터, 최적화, 감독 선택을 공동으로 포착하는 구조화된 설정 공간에 대한 탐색으로 정식화함. 105. 학습 파이프라인은 π=(D,H,S)로 정의됨. 106. D는 데이터셋 명세임. 107. 여기에는 gold examples, hard negatives, replay data의 구성과 적용된 큐레이션 제약이 포함됨. 108. H는 하이퍼파라미터 설정임. 109. 여기에는 기본 모델, LoRA rank, learning rate, batch size, epoch 수, system prompt가 포함됨. 110. S는 학습 전략임. 111. 여기에는 감독 형식(직접 답변 또는 chain-of-thought), 주석 생성용 교사 모델, 평가 방법이 포함됨. 112. Π는 모든 유효 파이프라인의 공간임. 113. f: Π→R은 전체 학습 후 평가 루프를 실행해 홀드아웃 검증 성능을 반환하는 점수 함수임. 114. 분류와 NER에서는 accuracy 또는 F1을 사용함. 115. 생성 작업에서는 [0,1]로 정규화된 LLM-as-judge 점수를 사용함. 116. r: Π×2^X→Z_{\ge 0}는 홀드아웃 회귀 세트 R에서 이전에 맞았던 예시를 새 모델이 틀린 개수를 세는 함수임. 117. 최적화 목적은 r(π;R)≤ε 제약 아래 f(π)를 최대화하는 것임. 118. 실제로 ε=2를 사용함. 119. 저자들은 상대 비율이 아니라 절대 개수 기반 회귀 제약을 채택함. 120. 이유는 프로덕션 환경에서 단 하나의 체계적 회귀 패턴도 조사 대상이 되기 때문임. 121. 상대 임계값을 쓰면 테스트 세트가 커질수록 더 많은 회귀를 허용하게 됨. 122. 이런 보수적 선택은 탐색 유연성보다 배포 안전성을 우선시함. 123. 회귀 제약은 프로덕션 모드에서만 적용됨. 124. 콜드스타트 모드에서는 보호할 기존 모델이 없으므로 제약 없는 목적을 사용함. 125. 그림 3은 ARC-Challenge에서 Llama 3.2-3B를 대상으로 한 11회 반복의 MCGS 궤적을 보여줌. 126. 각 노드는 완료된 학습 파이프라인과 그 점수에 대응함. 127. 엣지는 특정 설정이 왜 성공하거나 실패했는지에 대한 에이전트의 인과 추론을 표현함. 128. 그래프는 형식 학습 단계(Branch A, 5.3%→61.3%), 연쇄적 사고 발견 단계(Branch B, 68.6%), DeepSeek-R1 추론 추적과 검증 데이터 확장을 결합한 가지 간 융합 단계(Iteration 6, 72.6%)의 세 핵심 단계를 보여줌. 129. 융합 이후 확장인 Iterations 7–11은 모두 성능이 하락해 가지치기됨. 130. 이는 수렴을 확인함. 131. 그림 4는 Pioneer Agent의 두 운영 모드를 보여줌. 132. 콜드스타트 모드는 자연어 작업 명세를 입력받아 데이터를 다운로드하고 평가 세트를 만들고 학습 커리큘럼을 합성하며 에이전트 유도 탐색으로 반복함. 133. 선택된 실행에서는 이 탐색에 MCGS를 사용함. 134. 프로덕션 모드는 판정된 추론 실패가 있는 배포 모델을 입력받아 실패 분류 체계를 만들고 교정 학습 데이터(gold corrections, hard negatives, replay buffer)를 합성하고 재학습하며 실패 평가 세트와 이전에 맞았던 행동에 대한 회귀 게이트를 둘 다 통과한 경우에만 업데이트를 수용함. 135. 함수 f는 닫힌 형식 표현도 유용한 기울기도 없음. 136. 각 평가는 모델 학습과 전체 검증 세트 추론을 요구함. 137. 탐색 공간 Π도 이질적임. 138. D, H, S는 분해할 수 없는 상호작용을 가짐. 139. 예시로 chain-of-thought 감독은 direct-answer 감독보다 더 많은 epoch를 요구함. 140. 또 더 큰 데이터셋은 더 낮은 learning rate를 요구할 수 있음. 141. 따라서 고정 파라미터 그리드 위의 표준 최적화인 grid search나 random search는 적절하지 않음. 142. 대신 어떤 설정이 왜 성공하거나 실패했는지 추론하는 탐색 절차가 필요함. 143. 에이전트는 MCGS로 Π를 탐색함. 144. 전통적 하이퍼파라미터 탐색은 각 설정을 독립적으로 다루지만 MCGS는 관계를 인코딩한 DAG G=(V,E)를 유지함. 145. 각 노드 v_i=(π_i,f(π_i))는 데이터 구성 또는 수정, 모델 학습, 홀드아웃 평가를 포함한 완료된 반복을 기록함. 146. 엣지 (v_i,v_j)는 π_j가 데이터 큐레이션, 하이퍼파라미터 변경, 감독 전환 같은 표적 수정으로 π_i에서 파생되었음을 뜻함. 147. 이 구조는 에이전트가 고립된 시도 대신 궤적을 추론할 수 있게 함. 148. 또한 계보를 보존해 성능 변화의 원인을 특정 개입에 귀속시킬 수 있게 함. 149. 성공 패턴을 재사용하고 비생산적 탐색 영역을 피할 수도 있음. 150. 따라서 그래프는 무엇을 시도했는지뿐 아니라 왜 시도했는지도 포착함. 151. 각 단계에서 에이전트는 리프 노드 v_parent를 선택하고 확장 연산자로 자식 설정을 제안함. 152. Expand는 오케스트레이터 LLM이 구현함. 153. 이 LLM은 부모 궤적을 검사하고 실패 모드를 진단하며 가설 기반 수정을 제안함. 154. 예시로 과적합에 대응해 epoch를 줄이거나 체계적 라벨 혼동을 해결하기 위해 hard negatives를 도입할 수 있음. 155. 각 새 실험은 관찰된 실패에 대한 추론된 대응이므로 무작위 교란보다 효율성과 해석 가능성이 높음. 156. 모든 자식 노드는 전체 파이프라인 실행으로 점수화됨. 157. 저자들은 조기 학습 손실이나 단축 실행으로 최종 정확도를 예측하는 surrogate model을 쓰지 않음. 158. 이유는 복잡한 학습 동역학에서 surrogate가 도입하는 편향을 정량화하기 어렵기 때문임. 159. 따라서 노드 점수는 계산 비용은 크지만 실제 작업 성능을 반영함. 160. 조상 통계에 이 점수를 전파하면 그래프의 선택 정책도 신뢰 가능한 피드백에 기반하게 됨. 161. 탐색과 활용의 균형을 위해 노드 선택은 UCT 유사 점수를 사용함. 162. 이 점수는 자손 평균 보상, 전체 평가 노드 수, 방문 횟수, 시간에 따라 감소하는 탐색 계수 c(t)로 계산됨. 163. 탐색 초반에는 큰 c(t)가 설정 공간의 넓은 커버리지를 장려함. 164. 탐색이 진행되면 c(t)가 감소함. 165. 이후 에이전트는 현재 그래프 구조와 남은 계산 예산에 따라 선택된 K에 대해 top-K 활용 단계로 전환함. 166. 이때 가장 높은 점수의 K개 노드만 확장함. 167. 결과적으로 초기에는 넓게 탐색하고 후기에는 유망한 설정을 정밀하게 다듬음. 168. 독립 가지들이 발전하면 상호보완적 전략을 발견할 수 있음. 169. 이때 에이전트는 여러 가지의 top-K 노드를 하나의 후보로 융합할 수 있음. 170. 예시로 한 가지가 hard negatives의 효과를, 다른 가지가 더 많은 epoch의 효과를 발견하면 융합은 둘을 함께 결합한 설정을 만듦. 171. 융합은 정체 회복 메커니즘 두 가지 중 하나이기도 함. 172. 에이전트가 가지의 개선 정체를 감지하면 궤적 인식형 돌연변이인 evolution을 실행하거나 상보적 가지와 융합함. 173. 이 두 메커니즘은 탐색이 지역 최적점에 갇히는 것을 막음. ### 2.3 Data Curation 174. 두 모드는 학습 데이터셋을 만들 때 동일한 데이터 큐레이션 원칙을 따름. 175. 예시 출처는 다름. 176. 콜드스타트 모드는 다운로드 또는 합성 데이터를 사용함. 177. 프로덕션 모드는 교정된 추론 실패를 사용함. 178. 그러나 두 경우 모두 일관성을 위해 같은 품질 관리가 적용됨. ##### Dataset Composition 179. 모든 학습 데이터셋은 세 개 슬라이스로 조립됨. 180. 목표 비율은 모드와 모델 성숙도에 따라 달라짐. 181. Gold examples는 40–60%를 차지함. 182. 콜드스타트에서는 다운로드한 벤치마크의 정답 입출력 쌍임. 183. 프로덕션에서는 수정된 실패 사례임. 184. Hard negatives는 25–35%를 차지함. 185. 이는 정답이 그럴듯한 오답과 다른 혼동성 입력으로, 모델이 미세한 결정 경계를 학습하도록 강제함. 186. Replay buffer는 10–20%를 차지함. 187. 이는 부모 모델의 학습 데이터에서 샘플링되어 catastrophic forgetting을 방지함. 188. 이 슬라이스는 이미 미세조정된 모델을 개선하는 프로덕션 모드에서만 사용함. 189. 기본 모델에서 시작할 때는 생략되고 그 비중은 gold examples로 재분배됨. 190. 저자들은 hard negatives 사용이 필수적임을 경험적으로 확인함. 191. 각 경계 사례 gold example마다 에이전트는 유사 입력이지만 다른 정답을 가진 counterexample을 생성함. 192. 이는 모델에게 언제 발화해야 하는지뿐 아니라 언제 발화하지 말아야 하는지를 가르침. 193. Replay buffer는 이미 미세조정된 모델 개선 시 catastrophic forgetting을 방지함. 194. 기본 모델에서 시작할 때 replay 비중은 gold examples로 재할당됨. ##### Quality Controls 195. 데이터셋 품질은 다섯 제약으로 관리됨. 196. 첫째, 2-for-1 규칙임. 197. 각 어려운 사례마다 gold example 하나와 유사 입력·다른 정답의 hard negative 하나를 생성함. 198. 둘째, 라벨 균형임. 199. 어떤 단일 라벨도 다른 라벨의 3배를 넘지 않음. 200. 이는 다수 클래스 prior 학습을 방지함. 201. 셋째, 문맥 길이 매칭임. 202. 학습 예시의 길이 분포는 실제 입력 분포 또는 실패 추론 분포와 일치해야 함. 203. 넷째, 엔터티 다양화임. 204. NER 작업에서는 어떤 단일 엔터티 값도 2–3회 이상 등장하지 않음. 205. 예시 간 엔터티 값은 합성 등가값으로 대체되어 표면형 암기를 방지함. 206. 다섯째, chain-of-thought 주석임. 207. 생성 작업에서는 GPT-4.1 또는 DeepSeek-R1 같은 교사 모델이 단계별 추론 연쇄를 생성함. 208. 이는 모델이 무엇이 정답인지뿐 아니라 왜 정답인지도 배우게 함. 209. 추가로 각 라벨은 개별 예시 수를 넘어서 다양성을 강제하기 위해 3–5개의 서로 다른 표면 텍스트 패턴을 가져야 함. ##### Dataset Sizing 210. 에이전트는 큰 노이즈 데이터셋보다 작고 고품질인 데이터셋을 목표로 함. 211. 분류와 NER 작업에서는 총 100–200개 예시가 일반적임. 212. 생성 작업에서는 작업 복잡도에 따라 500–3,000개 예시가 일반적임. 213. 경험적으로 시스템은 데이터 추가 시 정확도 회귀를 모니터링함. 214. 데이터셋 확대가 검증 정확도를 떨어뜨리면 에이전트는 즉시 롤백함. ### 2.4 Iteration Policy 215. 콜드스타트와 프로덕션 모드는 각 학습 실행 후 평가 결과에 대응하는 공통 반복 정책을 공유함. 216. 에이전트는 검증 점수 f(π)에 따라 구조화된 의사결정 트리를 따름. 217. 점수 < 0.80이면 데이터셋의 근본적 재작업이 필요함. 218. 이 경우 에이전트는 남은 실패를 분석하고 누락된 라벨 범위, 분포 불일치, hard negatives 부족 같은 체계적 공백을 식별해 학습 데이터를 다시 구축함. 219. 이 임계값에서는 문제를 하이퍼파라미터 문제가 아니라 데이터 문제로 간주함. 220. 점수 0.80–0.95이면 먼저 하이퍼파라미터를 조정함. 221. 예시로 더 많은 epoch, 다른 learning rate, 더 큰 기본 모델, 조정된 LoRA rank를 시도함. 222. 이때 데이터셋은 고정하여 최적화 변화 효과를 분리함. 223. 점수 > 0.95이면 남은 각 실패 패턴마다 2–3개 표적 예시를 추가함. 224. 이 단계에서는 대규모 데이터 변경이 회귀 위험을 키우므로 외과적 증강으로 전환함. 225. 이전 반복보다 회귀하면 즉시 이전 데이터셋과 설정으로 롤백함. 226. 더 많은 데이터가 항상 더 좋은 것은 아님. 227. 따라서 에이전트는 어떤 점수 하락도 보정할 신호가 아니라 되돌릴 신호로 다룸. 228. 이 정책은 두 가지 원칙을 인코딩함. 229. 첫째, 지배적 오류 원인은 점수가 올라갈수록 바뀜. 230. 낮은 점수는 데이터 문제를, 중간 점수는 최적화 문제를, 높은 점수는 외과적 개입 필요를 의미함. 231. 둘째, 누적보다 롤백을 항상 선호함. 232. 각각 새로운 실패 모드를 만드는 연쇄적 수정이 반복 미세조정 정체의 주원인임. ### 2.5 Cold-Start Mode 233. 콜드스타트 모드에서 에이전트는 자연어 작업 설명만 받고 자율적으로 미세조정 모델을 만들어야 함. 234. 입력은 작업 명세 τ=(description,M,constraints)로 형식화됨. 235. description은 자연어 지시임. 236. 예시로 “Llama 3.2-3B를 ARC-Challenge에 미세조정하라”가 있음. 237. M은 기본 모델 계열임. 238. constraints는 목표 지표, 출력 형식, 도메인 제한 같은 사용자 요구를 담음. 239. 이전 모델이 없으므로 에이전트는 제약 없는 목적함수를 풂. 240. 즉 작업 적합 지표에 대한 홀드아웃 검증 점수 f(π)를 최대화함. 241. 보호할 배포 모델이 없으므로 회귀 제약은 적용되지 않음. 242. 워크플로는 다섯 단계로 진행됨. ##### Input and Tools 243. 에이전트는 web_search, bash, read_file, edit_file 네 가지 도구를 가짐. 244. web_search는 Exa deep research API임. 245. bash는 사전 로드된 학습 helper가 있는 무제한 셸 접근임. 246. 에이전트는 delegate_task를 통해 하위 에이전트를 생성해 작업을 병렬화할 수 있음. 247. 예시로 한 하위 에이전트에 데이터 합성을 맡기고 다른 하위 에이전트가 평가 세트를 구축할 수 있음. 248. 하위 에이전트는 같은 파일시스템을 공유함. 249. 따라서 메인 에이전트는 하위 에이전트가 디스크에 쓴 요약을 읽을 수 있음. 250. 원시 데이터를 자신의 컨텍스트에 모두 로드할 필요는 없음. ##### Task Analysis 251. 주어진 τ에 대해 에이전트는 작업 종류, 존재하는 데이터, 달성 가능한 성능을 파악해야 함. 252. 워크플로는 세 단계임. 253. 첫째, 작업 분류임. 254. 에이전트는 작업 설명을 파싱해 작업 유형 t를 분류, NER, 생성 중 하나로 결정함. 255. 그리고 M에서 적절한 모델 계열을 선택함. 256. 작업 유형은 감독 형식, 평가 지표, 데이터 큐레이션 전략을 결정함. 257. 둘째, 데이터 획득임. 258. 에이전트는 관련 데이터셋, 코드 예시, 도메인 지식을 찾기 위해 웹 리서치를 수행함. 259. 사용자가 CoNLL-2003나 GSM8K 같은 알려진 벤치마크를 명시하면 에이전트는 합성 대체물을 만들지 않고 실제 벤치마크 데이터를 다운로드함. 260. 공개 데이터셋이 없는 맞춤형 작업에서는 교사 모델로 seed example을 합성한 뒤 이를 검증하고 확장함. 261. 셋째, 기준선 조사임. 262. 에이전트는 대상 작업의 발표된 기준선과 최신 성능(SOTA)을 조사해 목표 성능을 보정함. 263. 이 단계는 라벨 모호성, 클래스 불균형, 도메인 특화 형식 요구 같은 알려진 난점을 식별함. 264. 이런 정보는 데이터 큐레이션 전략에 반영됨. 265. SOTA 결과가 있으면 에이전트는 고정 임계값 대신 발표 수치에 상대적인 초기 정확도 목표를 설정함. ##### Evaluation Setup 266. 어떤 학습보다 먼저 에이전트는 성공 기준을 정의하는 홀드아웃 평가 세트 E를 구축함. 267. 이 세트는 세 보완 슬라이스로 구성됨. 268. E_pos는 전체 라벨 또는 엔터티 범위를 덮는 정답 입출력 쌍을 담음. 269. E_neg는 어떤 라벨도 발화하면 안 되는 부정 예시를 담음. 270. E_boundary는 미세한 구분 능력을 시험하기 위한 결정 경계의 혼동 쌍을 담음. 271. 생성 작업에서는 E_neg 대신 적대적 입력을 사용함. 272. 예시로 ill-posed questions와 out-of-domain prompts가 있음. 273. 생성 작업의 E_boundary는 다단계 추론이나 엣지 케이스 처리가 필요한 문제를 포함함. 274. 이 검증 세트는 반복 과정 내내 고정됨. 275. 또한 학습 데이터에 절대 포함되지 않음. 276. 기본 종료 기준은 E에서 f(π)≥τ를 요구함. 277. 기본값은 τ=0.96임. 278. 이 값은 분류와 NER에서는 accuracy 또는 F1에 적용됨. 279. 생성 작업에서는 LLM-as-judge 점수에 적용됨. 280. 그러나 이 임계값은 기본값이지 상수는 아님. 281. 에이전트는 데이터셋 특성과 기본 모델 능력에 따라 조정할 수 있음. 282. 프런티어 LLM은 진짜 plateau를 인식하는 데 효과적임. 283. 예시로 3B 모델이 사실 지식을 기억할 수 없는 용량 한계나 고칠 수 없는 라벨 모호성이 남은 실패의 원인인 경우가 있음. 284. 이런 경우 에이전트는 달성 불가능한 목표에 계산 자원을 낭비하지 않도록 목표를 낮추고 조기 종료함. ##### Curriculum Synthesis 285. 에이전트는 2.3절의 공통 품질 관리를 따라 학습 데이터를 조립함. 286. 콜드스타트는 기본 모델에서 시작해 D_parent=∅이므로 replay buffer가 필요 없음. 287. 따라서 데이터셋은 두 보완 슬라이스로 구성됨. 288. D_cold = D_gold ∪ D_hard임. 289. D_gold는 다운로드한 벤치마크 데이터 또는 교사 모델 합성에서 나온 정답 입출력 쌍임. 290. D_hard는 2-for-1 규칙으로 생성된 hard negatives임. 291. Replay 비중은 D_gold로 재분배됨. 292. 그 결과 목표 비율은 대략 D_gold:D_hard ≈ 65:35임. 293. 생성 작업에서는 교사 모델로 GPT-4.1과 DeepSeek-R1 중 하나를 선택함. 294. 실제로 DeepSeek-R1은 GSM8K, ARC-Challenge 같은 수학·과학 추론에 선호됨. 295. GPT-4.1은 HumanEval, TriviaQA 같은 코드 생성과 일반 상식 작업에 선호됨. ##### Training and Iteration 296. 에이전트는 2.2절의 반복 탐색 절차로 파이프라인 공간 Π를 탐색함. 297. 탐색 그래프를 명시적으로 유지하는 경우 전체 MCGS를 사용함. 298. 각 반복에서 적어도 두 가지 설정을 병렬 학습함. 299. 예시로 full fine-tuning 대 LoRA, 또는 다른 기본 모델 조합을 비교함. 300. 각 설정은 전체 평가 세트 E에서 평가됨. 301. 반복 i의 파이프라인을 π_i, 점수를 f(π_i)라 둠. 302. 에이전트는 공통 반복 정책을 따름. 303. f(π_i)<0.80이면 데이터셋 재작업을 수행함. 304. 0.80≤f(π_i)<0.95이면 하이퍼파라미터 튜닝을 수행함. 305. f(π_i)≥0.95이면 표적 증강을 수행함. 306. 각 반복 후 에이전트는 E의 남은 실패를 분석함. 307. 이를 통해 다음 개입이 데이터셋 D, 하이퍼파라미터 H, 학습 전략 S 중 무엇을 겨냥해야 할지 결정함. 308. 예시로 direct-answer에서 chain-of-thought 감독으로 바꿀 수 있음. 309. 반복이 회귀하면 즉 f(π_{i+1})<f(π_i)이면 에이전트는 보정하지 않고 즉시 이전 설정으로 롤백함. 310. 탐색은 종료 기준을 만족하거나 1,500 LangGraph 턴의 계산 예산을 소진하면 종료됨. ### 2.6 Production Mode 311. 프로덕션 모드는 시스템의 핵심 기여임. 312. 실제 추론 실패가 있는 배포 모델이 주어지면 에이전트가 자율적으로 진단, 수정, 검증을 수행함. 313. 입력은 배포 모델 M_0와 판정된 추론 추적 집합 T임. 314. 각 항목은 입력 x_i, 모델 예측 ŷ_i, 교정 출력 y_i*, 판정값 v_i∈{pass, fail}, 판정 근거 r_i를 포함함. 315. 목표는 실패 세트에서 성능이 기존 파이프라인보다 높고 pass 예시 기반 회귀 세트에서 회귀 수가 ε 이하인 개선 모델 M_1을 만드는 파이프라인 π를 찾는 것임. 316. 그림 5는 GSM8K(Qwen3-8B)에서 단계별 배포 시뮬레이션을 보여줌. 317. 각 배포 단계의 주석은 poison filtering, contrastive pair construction, 실패 분석 기반 표적 예시 생성, 반복 회귀 시 자동 롤백 같은 핵심 결정을 보여줌. 318. 단순 재학습은 모든 데이터를 무차별적으로 사용해 첫 노이즈 단계에서 급격히 악화됨. 319. Listing 1은 query_traces 호출 예시를 보여줌. 320. 이 호출은 SQL과 bash 후처리를 한 번의 도구 호출에서 결합함. 321. SQL 결과는 bash 명령의 stdin으로 전달됨. 322. 출력된 요약만 에이전트 컨텍스트에 들어감. 323. 전체 데이터셋은 디스크에 저장됨. ##### Input and Tools 324. 에이전트는 query_traces, trace_analysis_subagent, bash, read_file, edit_file 다섯 도구를 사용함. 325. query_traces는 SQL과 선택적 bash 후처리를 지원함. 326. 이 도구는 질의 결과를 bash 명령의 stdin으로 직접 전달함. 327. 이를 통해 에이전트는 대량 결과셋을 원시 행으로 컨텍스트에 넣지 않고 필터링, 집계, 디스크 저장할 수 있음. 328. 실제로 수만 행 데이터베이스를 다룰 때도 에이전트 컨텍스트에는 보통 약 50개의 대표 예시만 포함됨. ##### Failure Diagnosis 329. 판정된 추론 추적이 주어지면 에이전트는 무엇이 망가졌는지, 왜 망가졌는지, 무엇이 학습으로 고쳐질 수 있는지 판단해야 함. 330. 저자들은 이를 네 단계로 나눔. 331. 첫째, trace ingestion임. 332. 로그를 실패 집합과 통과 집합으로 나눔. 333. 둘째, taxonomy construction임. 334. 실패를 실행 가능한 범주로 군집화하고 각 범주를 수정 가능 또는 외부 원인으로 라벨링함. 335. 셋째, live confirmation임. 336. 배포 모델을 직접 프로빙해 약점이 표본 잡음이 아닌 체계적 문제인지 확인함. 337. 넷째, parent model awareness임. 338. 모델 계보를 조사해 교정 데이터가 기존 학습 세트를 보완해야 하는지 처음부터 구축해야 하는지 판단함. 339. Trace ingestion 단계에서 각 레코드는 x_i, ŷ_i, y_i*, v_i, r_i, m_i를 가짐. 340. m_i는 판정 메타데이터를 담음. 341. 여기에는 판정 모델, 프롬프트 템플릿, 평가 기준이 포함됨. 342. 판정자는 토큰 수준 F1 같은 결정적 채점기일 수도 있고 DeepSeek 같은 LLM judge일 수도 있음. 343. 결정적 경우 r_i는 점수 세부 내역을 담고 y_i*는 gold reference가 됨. 344. 사람 override가 있으면 자동 판정보다 우선함. 345. 에이전트는 SQL로 현재 사용자 데이터에 대한 행 수준 필터링을 적용해 실패 세트 T_fail과 통과 세트 T_pass를 얻음. 346. 이 신호는 어떤 추론이 왜 실패했고 교정 출력이 무엇이어야 하는지를 알려줌. 347. Taxonomy construction 단계에서 에이전트는 T_fail을 K개의 실패 군집으로 분할함. 348. 각 군집 C_k에 대해 크기 |C_k|를 기록함. 349. 또한 지배적 입력 특성을 기록함. 350. 예시로 길이 분포, 구조 패턴, 엔터티 유형 구성이 포함됨. 351. 그리고 각 군집에 fixable 또는 external의 수정 가능 라벨 φ_k를 부여함. 352. External 실패는 프롬프트 설계 오류, 스키마 불일치, 진짜 모호한 입력 같은 외부 요인으로 간주됨. 353. 복잡한 분석은 토큰 한도가 10배 높은 Trace Analyzer 하위 에이전트에 위임됨. 354. 이 하위 에이전트는 실패 taxonomy, confusion matrix, 대표 입력 예시 같은 구조화 출력물을 만들고 디스크에 저장함. 355. 메인 에이전트는 요약만 읽어 고수준 의사결정에 컨텍스트를 보존함. 356. Live confirmation 단계에서는 학습 데이터를 만들기 전에 각 약점이 체계적인지 확인함. 357. 이를 위해 각 수정 가능 군집 C_k에 대해 표적 입력 집합 P_k를 합성하고 배포 모델에서 평가함. 358. 프로브 구성은 실패 모드에 따라 달라짐. 359. 두 라벨을 혼동하면 이를 구분하는 경계 사례 입력을 생성함. 360. 긴 입력에서 실패하면 기존에 맞았던 짧은 입력을 늘려 파손 지점을 찾음. 361. 특정 엔터티 유형을 놓치면 해당 엔터티를 명시적으로 포함한 합성 예시를 만듦. 362. 이 단계는 약점의 체계성을 확인하는 역할과 교정 학습 데이터셋 구축에 직접 쓰일 표적 실패 예시를 생성하는 역할을 동시에 수행함. 363. Parent model awareness 단계에서 에이전트는 먼저 모델이 이미 어떤 감독을 받았는지 판단함. 364. 실패 추론에 연결된 model_id를 조사해 모델 학습 계보를 복원함. 365. 이를 통해 기본 체크포인트와 이전 미세조정 모델을 구분함. 366. D_parent는 가장 최근 미세조정 실행의 학습 데이터셋임. 367. 배포 모델이 기본 체크포인트면 D_parent=∅임. 368. 모델이 base model이면 과제 특화 감독이 없으므로 에이전트는 추론 로그를 실패 패턴 식별에만 사용하고 학습 데이터셋은 처음부터 구축함. 369. 모델이 UUID로 식별되는 이미 미세조정된 모델이면 에이전트는 D_parent를 가져와 기존 감독을 복제하지 않고 미포착 실패 모드를 겨냥하는 상보적 데이터셋을 구축함. 370. catastrophic forgetting을 줄이기 위해 D_parent의 약 10–20% 크기의 replay buffer D_replay도 포함함. 371. 모든 경우 학습은 이전 미세조정 체크포인트가 아니라 기본 파운데이션 모델에서 다시 시작함. 372. 이렇게 하면 모델 동작이 현재 반복의 데이터셋에 의해 완전히 결정됨. 373. 따라서 실패를 현재 데이터셋의 공백이나 오류에 직접 귀속시킬 수 있음. 374. 또한 롤백도 단순해짐. 375. 이전 데이터셋으로 되돌리면 해당 모델 동작이 깔끔하게 복원됨. 376. 연속 미세조정 사이 상호작용을 풀어낼 필요가 없음. 377. 그림 6은 두 Pioneer Agent 모드를 통합한 end-to-end 폐쇄 루프 파이프라인을 보여줌. 378. 콜드스타트 모드에서는 자연어 작업 설명에서 시작해 데이터 획득, 평가 설정, 커리큘럼 합성, 에이전트 유도 반복으로 진행함. 379. 프로덕션 모드에서는 판정된 추론 실패가 실패 진단, taxonomy 구성, 표적 커리큘럼 합성, 회귀 게이팅을 포함한 재학습, 조건부 배포로 이어짐. 380. 두 모드는 같은 데이터 큐레이션 원칙과 반복 정책을 공유함. 381. 따라서 하나의 시스템이 초기 모델 생성과 배포 후 지속 개선을 모두 처리할 수 있음. ##### Evaluation Setup 382. 평가는 T에서 유도된 두 보완 세트에 의존함. 383. Evaluation set은 T_fail 전체로 구성됨. 384. 평가는 원래 판정에 사용한 것과 동일한 판정 방법을 사용함. 385. 이는 결정적 채점기일 수도 있고 추론 테이블 메타데이터에 저장된 동일 기준의 LLM judge일 수도 있음. 386. Regression set은 이전에 통과했던 추론들의 구조화 샘플임. 387. 이 세트는 모델의 기존 강점을 관련 차원 전반에서 덮도록 구성됨. 388. 예시로 분류와 NER에서는 라벨 유형과 엔터티 유형을 포함함. 389. a(π)는 evaluation-set 점수임. 390. r(π)는 regression count임. 391. 기본 종료 기준은 a(π)≥τ와 r(π)≤ε를 동시에 요구함. 392. 기본적으로 τ=0.96, ε=2임. 393. 콜드스타트와 마찬가지로 0.96은 기본값일 뿐임. 394. 에이전트는 남은 실패가 학습으로 해결 불가능하다고 판단하면 이를 낮출 수 있음. 395. 예시로 failure taxonomy가 적대적 입력, 분포 밖 질의, 상류 라벨 오류가 지배적이라고 드러낼 수 있음. 396. 에이전트는 실패 패턴을 프로그램적으로 분석하고 추가 데이터가 문제를 해결할 가능성을 추론해 이런 사례를 진단함. 397. 후보 모델은 두 게이트를 모두 만족할 때만 수용됨. 398. 그렇지 않으면 에이전트는 반복을 계속하거나 이전 최고 체크포인트로 롤백함. ##### Curriculum Synthesis 399. 확인된 수정 가능 군집들로부터 에이전트는 2.3절의 공통 원칙을 따르는 표적 학습 커리큘럼을 구축함. 400. 결과 데이터셋은 세 보완 슬라이스로 구성됨. 401. D_post = D_gold ∪ D_hard ∪ D_replay임. 402. D_gold는 실패 추적의 수정 버전으로 구성됨. 403. 수정은 judge 또는 사람 주석 y_i*를 사용함. 404. D_hard는 M_0가 그럴듯하지만 틀린 출력을 내는 혼동 쌍에서 파생된 hard negatives를 담음. 405. D_replay는 이전에 정의된 replay buffer로, 기존 학습 행동 보존을 위해 포함됨. 406. 상대 구성비는 관찰된 실패 모드에 따라 조정됨. 407. 재현율(recall) 오류가 지배적인 군집은 gold examples 비중을 높여 해결함. 408. 정밀도(precision) 오류, false positive, 라벨 혼동이 특징인 군집은 hard negatives 비중을 더 높임. 409. 모든 예시는 공통 품질 제약을 따름. 410. 따라서 결과 데이터셋은 관찰 실패에 표적화되면서 전체 큐레이션 프레임워크와도 일관됨. ##### Training and Iteration 411. 에이전트는 D_post로 학습하고 evaluation set과 regression set 모두에서 결과 모델을 평가함. 412. r(π)≥ε이면 그 반복은 거부됨. 413. 그리고 에이전트는 이전 최고 체크포인트로 되돌아감. 414. 반복은 공통 정책을 따름. 415. 점수 80% 미만이면 데이터셋 재작업을 수행함. 416. 80–95%이면 하이퍼파라미터 튜닝을 수행함. 417. 95% 초과이면 표적 증강을 수행함. 418. 한편 에이전트는 프로덕션 실행당 최대 500 LangGraph 턴을 사용할 수 있음. 419. 데이터 집약적 단계인 실패 분석과 trace sampling에는 하위 에이전트를 활용함. 420. 종료 기준을 만족하면 개선 모델 M_1이 새 배포 후보로 승격됨. ### 2.7 Structural Safeguards 421. 자율 미세조정의 핵심 위험은 프로덕션 추론 데이터에 대한 과적합임. 422. 프로덕션 데이터는 종종 노이즈가 많고 편향되어 있으며 시간적으로 상관됨. 423. 앞서 설명한 메커니즘들이 이 위험을 함께 완화함. 424. 여기에는 hard negatives와 라벨 균형, rollback-first 반복 정책, 2–3개 설정의 병렬 학습, 프로덕션 모드 회귀 게이팅이 포함됨. 425. 이 메커니즘들은 데이터 구성과 업데이트 수용을 함께 제약함. 426. 여기에 한 가지 추가 장치가 더해짐. 427. 그것은 cross-checkpoint regression gate임. 428. 프로덕션 모드에서는 새 실패가 발견될수록 evaluation set이 시간이 지나며 변함. 429. 이로 인해 temporal overfitting 위험이 생김. 430. 즉 최신 실패 슬라이스에서는 좋아지지만 이전에 고친 행동을 조용히 악화시킬 수 있음. 431. 이를 막기 위해 후보 모델이 현재 evaluation set에서 점수 임계값에 도달하면 직전 체크포인트의 evaluation set에서도 추가 평가함. 432. 모델은 두 세트 모두에서 r(π)≤ε를 만족해야 함. 433. 구체적으로 허용 회귀는 최대 2개임. 434. 이는 새 데이터에서의 개선이 이전 성과를 해치지 않도록 강제함. 435. replay buffer와 결합하면 ratchet effect가 생김. 436. 즉 수용되는 각 업데이트는 이전에 검증된 행동을 유지하면서 새로운 개선을 포함해야 함. 437. 그 결과 연속 미세조정 라운드 전반에서 단조 비감소 성능을 유도함. 438. 표 1은 이 논문에서 사용한 AdaptFT-Bench 시나리오를 보여줌. 439. 처음 7개는 아래 단계 기반 프로토콜로 평가한 벤치마크 기반 합성 로그 시나리오임. 440. CLINC150과 CoNLL-2003은 프로덕션형 배포 사례 연구임.