LOTS-OResearch Notes

TL;DR

  • Anthropic과 OpenAI는 2026년 프런티어 모델을 안전장치를 적용한 범용 플래그십과 일부 안전 제약을 낮춘 사이버 특화 모델로 나누는 같은 전략에 수렴했다.
  • Anthropic은 같은 모델을 안전장치 유무에 따라 Fable 5.1(범용)과 Mythos 5.1(사이버, Project Glasswing 초대제)로 나눈다.
  • OpenAI는 범용 GPT-5.6 Sol과 별도 훈련한 GPT-5.6-Cyber를 두고 Daybreak 프로그램의 Blue/Red 접근 티어로 통제한다.
  • 두 회사 모두 사이버 같은 고위험 능력을 제한된 채널로 제공한다. Anthropic은 모델에 적용한 안전장치, OpenAI는 프로그램별 접근 권한을 주된 통제 수단으로 삼는다.

두 회사는 범용 모델과 접근 제한형 사이버 모델을 함께 운영한다

전략 요지

2026년 중반 Anthropic과 OpenAI는 최상위 모델의 배포 경로를 이원화했다. 범용 플래그십에는 안전장치(safeguard)를 적용해 널리 제공한다. 사이버 보안이나 과학처럼 위험이 큰 영역의 모델은 일부 제약을 낮추는 대신 승인된 사용자에게만 제공한다. 제품명과 구현 방식은 달라도 최상위 능력과 접근 권한을 분리한다는 원칙은 같다. 모델 순위만 보면 이 구조를 놓친다. 배포 경로와 접근 조건까지 함께 봐야 한다.

모델 구성 (2026-09 기준)

티어·역할Anthropic (Claude)OpenAI (GPT)
프런티어 능력 등급Mythos-class (Opus class 상위)GPT-5.6 (Luna < Terra < Sol)
범용 안전 플래그십Claude Fable 5.1 (← Fable 5)GPT-5.6 Sol
접근 제한형 사이버 특화Claude Mythos 5.1 (← Mythos 5, 초대제)GPT-5.6-Cyber (Sol 기반)
사이버 접근 프로그램Project Glasswing (미국 정부 파트너)Daybreak (Blue: 방어자 개방 / Red: Cyber 승인제)

Anthropic은 하나의 모델을 안전장치로 나눈다

  • Mythos-class는 Opus class(예: Opus 4.8) 위에 있는 능력 티어다. Anthropic은 "a tier of Claude models that sit above our Opus class in capability"로 설명한다.
  • FableMythos같은 아키텍처를 공유하고 안전장치와 접근 범위만 다르다. Anthropic은 "The safeguards are what distinguish the two models"라고 설명한다. 이 분기는 두 세대에 걸쳐 유지됐다. Fable 5 / Mythos 5(2026-06-09)에 이어 Fable 5.1 / Mythos 5.1(2026-09-01)이 나왔다.
  • Fable 5.1(claude-fable-5-1)은 안전장치를 적용한 범용판으로 모든 고객에게 공개된다(API·Bedrock·Google Cloud·Microsoft Foundry). 민감한 요청은 거부하거나 하위 모델(Opus 4.8·Opus 5)로 넘긴다. 지식 기준 시점은 2026-06이고 컨텍스트 창은 100만 토큰이다. 코딩·장시간 에이전트 작업·문서 작업이 향상됐으며 Anthropic은 Opus 5·GPT-5.6 Sol 대비 벤치마크 우위를 주장한다.
  • Mythos 5.1(claude-mythos-5-1)은 Fable 5.1과 동일 모델이다. 안전장치를 제거한 대신 Project Glasswing 참가자에게 초대제로만 제공한다(사이버·생명과학 검증 프로그램, 현재 미국 조직 한정). Mythos 계열은 세계 최강급 사이버 능력을 내세우며 제로데이를 자율 발굴한 실적이 있다(OpenBSD TCP SACK 원격 코드 실행(RCE), FreeBSD NFS RCE(CVE-2026-4747)). 신약 설계는 약 10배 빨라졌다고 보고했다.
  • 가격은 두 모델 모두 100만 토큰(MTok)당 입력 $10, 출력 $50로 Fable 5와 같다. 캐시 읽기 가격만 $1.00에서 $0.25로 75% 낮췄다. 그 밖에 대화 중 추론 노력(effort) 조절, 단일 턴 시스템 메시지, 콘텐츠 워터마크가 추가됐다.

OpenAI는 모델과 접근 권한을 함께 분리한다

  • GPT-5.6은 Luna·Terra·Sol 세 변형(하→상)으로 2026-07-09 출시됐다. Sol은 최상위 범용 플래그십이며 코딩·지식 노동·사이버·과학에서 최고 수준 성능을 표방한다.
  • GPT-5.6-Cyber는 GPT-5.6 Sol을 기반으로 사이버 보안 성능을 높이고 공격과 방어에 모두 쓰일 수 있는 작업의 거부를 줄이도록 특화 훈련한 모델이다. 제로데이 발굴과 공격 체인(exploit chain) 개발 등을 겨냥한다. 내부 평가인 '고급 사이버 보안 완료율'에서 공격 체인·인증 우회·권한 상승 요청의 95.0%를 완료했다. 같은 요청을 Daybreak Blue의 GPT-5.6 Sol은 2.0%, 안전장치를 적용한 Sol은 1.5%만 완료했다. 접근 등급에 따라 실제 제공되는 능력이 달라진다.
  • Daybreak는 사이버 보안 프로그램이다. 2026-08-10 확장 발표에서 접근 권한을 두 등급으로 나눴다.
    • Daybreak Blue는 대부분 방어자의 출발점이다. 보안 사고 대응·악성코드 분석·패치 검증 같은 일상 보안 작업에 범용 프런티어 모델(GPT-5.6 Sol 포함)을 개방한다.
    • Daybreak Red는 취약점 연구·취약점 공격(exploit) 검증·보안 테스트용이다. GPT-5.6-Cyber는 신뢰 고객 파트너(Accenture·IBM·CrowdStrike·Cloudflare)에게만 제공한다.
  • 접근 통제로 2026-09-01부터 모든 Daybreak 계정에 하드웨어 보안 키를 요구한다.

전략 비교

AnthropicOpenAI
분기 방식한 모델을 안전장치 유무에 따라 Fable/Mythos로 분기범용 Sol과 특화 Cyber를 별도 모델로 분리
안전 통제 방식위험한 요청을 하위 모델(Opus 4.8·Opus 5)로 전환접근 티어(Blue/Red)와 하드웨어 키
접근 승인 주체정부 협업 프로그램(Project Glasswing)승인 고객·신뢰 파트너
사이버 능력 공개프런티어는 제한 배포, 안전판만 일반 개방특화 모델을 파트너 한정 배포

두 회사 모두 공격적 사이버 능력을 제한된 채널에 배치한다. Anthropic은 모델에 적용한 안전장치로 통제하고 OpenAI는 프로그램별 접근 권한으로 통제한다.

Red와 Blue는 OpenAI Daybreak의 접근 등급이다. Blue는 방어·범용 작업, Red는 공격 역량이 필요한 승인 작업을 가리킨다. Anthropic에는 이에 대응하는 제품명 체계가 없다.

시사점

  • 모델 이름만으로는 실제 사용 범위를 판단하기 어렵다. 프로그램 자격, 파트너 지위, 하드웨어 키 요구가 접근 범위를 결정한다.
  • 공격 능력이 커질수록 오용 위험도 함께 커지므로 두 회사 모두 사이버 모델의 배포 범위를 제한한다.
  • 같은 최상위 능력도 안전장치와 접근 권한에 따라 별도 제품으로 제공된다. 실무에서는 모델 성능과 함께 사용 가능한 배포 채널을 확인해야 한다.

Open Questions

  • Mythos 5.1과 GPT-5.6-Cyber의 실제 사이버 벤치마크(제로데이 발굴률, 취약점 공격 성공률)는 어떻게 비교되나?
  • Anthropic의 위험한 요청에 대한 하위 모델 전환과 OpenAI의 접근 등급별 통제 중 어느 방식이 실제 오용 방지에 더 효과적인가?
  • Project Glasswing의 사이버·생명과학 검증 프로그램이 미국 외 조직으로 확대되나? (Mythos 5.1은 현재 미국 한정)
  • Daybreak Blue에서 제공하는 범용 프런티어 모델에 GPT-5.6 Sol 외 다른 모델도 포함되나?

Connections