Docs | Src |  A-  |  A*  |  A+  | -/-

Metadata
sourcehttps://www.anthropic.com/news/claude-opus-4-8
created2026-06-04
byopenai:gpt-5.4
style번호식
# (요약) Introducing Claude Opus 4.8 1. Anthropic이 Claude Opus를 새 버전인 Claude Opus 4.8로 업그레이드함. 2. Claude Opus 4.8은 Opus 4.7을 기반으로 벤치마크 전반에서 개선되었고, 더 효과적인 협업자(collaborator)로 설계됨. 3. Claude Opus 4.8은 오늘부터 동일한 가격으로 제공됨. 4. Opus 4.8은 여러 신규 기능과 함께 출시됨. 5. claude.ai 사용자는 이제 Claude가 작업에 투입하는 노력의 양을 제어할 수 있음. 6. Claude Code에는 매우 대규모 문제를 다룰 수 있게 하는 새로운 "동적 워크플로우(dynamic workflows)" 기능이 추가됨. 7. Opus 4.8의 fast mode는 모델이 2.5배 속도로 작업할 수 있는 모드임. 8. Opus 4.8의 fast mode 가격은 이전 모델 대비 3배 저렴해짐. ## Opus 4.8의 역량 9. 표는 Opus 4.8이 코딩, 에이전트형(agentic) 기술, 추론, 실무형 지식 작업 테스트에서 전작 및 다른 모델과 어떻게 비교되는지 보여줌. 10. 더 자세한 내용과 훨씬 폭넓은 역량 평가는 Claude Opus 4.8 시스템 카드(System Card)에 제공됨. ## Opus 4.8과의 협업 11. 초기 테스터들은 Claude Opus 4.8이 에이전트형 작업을 수행할 때 더 신뢰할 수 있고 판단력이 더 날카롭다고 평가함. 12. 해당 섹션 아래에는 Opus 4.8과 협업한 경험에 대한 여러 테스터의 인용문이 제시됨. 13. Opus 4.8의 가장 두드러진 개선점 중 하나는 정직성(honesty)임. 14. Anthropic은 모든 모델이 정직하도록, 예를 들어 근거 없는 주장을 하지 않도록 훈련함. 15. 그러나 AI 모델의 일반적 문제는 근거가 충분하지 않은데도 작업에서 진전을 이뤘다고 성급하게 결론 내리고 자신 있게 주장하는 경우가 있다는 점임. 16. 초기 테스터들은 Opus 4.8이 자기 작업의 불확실성을 더 자주 표시하고, 근거 없는 주장을 할 가능성은 더 낮다고 보고함. 17. 이 평가는 Anthropic의 자체 평가 결과로도 뒷받침됨. 18. 평가 결과에 따르면 Opus 4.8은 전작보다 자신이 작성한 코드의 결함을 지적 없이 통과시키는 가능성이 약 4배 낮음. 19. Anthropic은 출시 전 언제나처럼 모델에 대해 상세한 정렬(alignment) 평가를 수행함. 20. 긍정적 특성 측면에서 정렬 팀은 Opus 4.8이 "사용자 자율성 지원과 사용자의 최선의 이익에 부합하는 행동 같은 친사회적 특성 측정치에서 새로운 최고치를 달성했다"고 결론 내림. 21. 해당 평가에서는 Opus 4.8의 비정렬 행동(misaligned behavior) 비율도 측정됨. 22. 여기에는 기만(deception)이나 오용 협조(cooperation with misuse) 같은 행동이 포함됨. 23. Opus 4.8의 비정렬 행동 비율은 Opus 4.7보다 실질적으로 낮음. 24. Opus 4.8의 비정렬 행동 비율은 가장 잘 정렬된 모델인 Claude Mythos Preview와 유사한 수준임. 25. 전체 정렬 평가는 배포 전 안전성 테스트 모음과 함께 Claude Opus 4.8 시스템 카드에 보고됨. ## 오늘 함께 출시되는 내용 26. Claude Opus 4.8 외에도 여러 업데이트가 함께 적용됨. 27. 첫 번째 업데이트는 동적 워크플로우(dynamic workflows)임. 28. 이 기능은 리서치 프리뷰(research preview)로 제공됨. 29. 이 기능은 Claude Code에서 Claude가 더 큰 작업을 맡을 수 있게 함. 30. Claude는 작업을 계획한 뒤 단일 세션에서 수백 개의 병렬 하위 에이전트(subagents)를 실행할 수 있음. 31. Opus 4.8에서는 이 에이전트들이 더 오랜 시간 실행될 수 있음. 32. Claude는 사용자에게 보고하기 전에 자신의 출력 결과를 검증함. 33. 예를 들어 Opus 4.8이 탑재된 Claude Code는 기존 테스트 스위트를 기준으로 삼아 수십만 줄 코드에 걸친 코드베이스 규모 마이그레이션을 시작부터 병합(merge)까지 수행할 수 있음. 34. 동적 워크플로우는 Claude Code의 Enterprise, Team, Max 요금제에서 사용 가능함. 35. 두 번째 업데이트는 claude.ai와 Cowork의 노력 제어(effort control) 기능임. 36. 모델 선택기 옆의 새로운 제어 장치를 통해 사용자는 Claude가 응답에 얼마나 많은 노력을 투입할지 선택할 수 있음. 37. 높은 노력 설정에서는 Claude가 더 자주, 더 깊이 생각해 더 나은 응답을 제공함. 38. 낮은 노력 설정에서는 Claude가 더 빠르게 응답하고 사용자의 rate limit를 더 천천히 소모함. 39. 이 노력 제어 기능은 모든 요금제에서 제공됨. 40. 세 번째 업데이트는 Messages API가 이제 messages 배열 내부의 system 엔트리를 허용한다는 점임. 41. 개발자는 프롬프트 캐시(prompt cache)를 깨뜨리거나 사용자 턴을 통해 업데이트를 우회하지 않고도 작업 중간에 Claude의 지시사항을 갱신할 수 있음. 42. 이 기능은 특정 하네스(harness)에서 에이전트가 실행되는 동안 권한, 토큰 예산, 환경 컨텍스트를 갱신하는 데 활용될 수 있음. ## 노력(effort)에 대한 설명 43. Opus 4.8의 기본 설정은 high effort임. 44. Anthropic은 이 설정이 품질과 사용자 경험 사이의 전반적으로 가장 좋은 균형이라고 판단함. 45. 코딩 작업에서 이 노력 수준은 Opus 4.7의 기본값과 비슷한 수의 토큰을 사용함. 46. 그러나 성능은 더 우수함. 47. 사용자는 "extra"(Claude Code에서는 `xhigh`) 또는 "max"를 선택할 수 있음. 48. 이 경우 모델은 더 나은 결과를 얻기 위해 더 많은 토큰을 사용함. 49. Anthropic은 어려운 작업과 장시간 실행되는 비동기 워크플로우에는 "extra" 사용을 권장함. 50. Anthropic은 더 높은 노력 수준의 높은 토큰 사용량을 수용하기 위해 Claude Code의 rate limit를 상향함. 51. 사용자는 각 프로젝트에 맞는 설정을 선택할 수 있음. ## 다음 계획 52. 사용자는 Opus 4.8이 전작보다 절제되어 있지만 분명히 체감되는 개선을 제공한다고 느낄 것임. 53. Anthropic은 아직 더 할 일이 남아 있다고 밝힘. 54. Anthropic은 Opus와 유사한 역량을 더 낮은 비용으로 제공하는 모델을 개발하고 출시하기 위해 작업 중임. 55. Anthropic은 Opus보다 더 높은 지능을 가진 새로운 모델 클래스도 출시할 계획임. 56. Project Glasswing의 일환으로 현재 소수의 조직이 사이버보안 업무에 Claude Mythos Preview를 사용 중임. 57. 이 수준의 역량을 가진 모델은 일반 공개 전에 더 강력한 사이버 안전장치(cyber safeguards)가 필요함. 58. Anthropic은 이러한 안전장치 개발에서 빠르게 진전을 이루고 있음. 59. Anthropic은 향후 몇 주 안에 Mythos급 모델을 모든 고객에게 제공할 수 있을 것으로 예상함. ## 제공 범위 60. Claude Opus 4.8은 오늘부터 모든 곳에서 사용 가능함. 61. 일반 사용 가격은 Opus 4.7과 동일하게 유지됨. 62. 일반 사용 입력 토큰 가격은 100만 토큰당 5달러임. 63. 일반 사용 출력 토큰 가격은 100만 토큰당 25달러임. 64. fast mode 입력 토큰 가격은 100만 토큰당 10달러임. 65. fast mode 출력 토큰 가격은 100만 토큰당 50달러임. 66. 개발자는 Claude API를 통해 `claude-opus-4-8` 모델을 사용할 수 있음. #### 각주 67. Terminal-Bench 2.1 점수는 모든 모델에 대해 Terminus-2 공개 하네스(public harness)를 사용해 보고됨. 68. GPT-5.5는 Codex CLI 하네스를 사용했을 때 83.4% 점수를 기록함. 69. OSWorld-Verified 평가는 모델의 실제 성능을 더 정확히 반영하도록 실행 방식이 변경됨. 70. 이에 따라 Opus 4.7 점수는 82.3%로 업데이트됨. 71. 관련 업데이트의 자세한 내용은 시스템 카드(System Card)에서 확인할 수 있음. 72. Finance Agent v2에서 Gemini 3.5 Flash는 57.9% 점수를 기록함. 73. 이는 Gemini 3.1 Pro 대비 상당한 개선임.