오픈AI] 오픈AI, 차세대 플래그십 모델 GPT-6 Astra 출시 • 오픈AI가 차세대 플래그십 GPT-6 Astra를… — 쿠쿠쿱 koob 6.0 — TG.ME

[오픈AI] 오픈AI, 차세대 플래그십 모델 GPT-6 Astra 출시

• 오픈AI가 차세대 플래그십 GPT-6 Astra를 출시했다. 컴퓨터 사용·코딩·과학·사이버보안에서 최고 성능이라고 밝혔다.
• 컴퓨터 사용 — OSWorld 기준 작업시간이 건당 75분 → 40분(47% 단축). OSWorld 2.0 72.6%(Sol 65.7), Agents' Last Exam 59.3%(Sol 53.6·Opus 5 55.5), Mind2Web 속도 Sol 대비 1.9배.
• 코딩·과학 — Terminal-Bench 4.0 57.7%(Fable 5.1 55.8), FrontierMath Tier 4 97.6%(Fable 5.1 87.8), Terminal-Bench Science 64.6%(Sol 22.4). 소수 간격 상한을 240 → 186으로 좁히는 데 기여했다.
• 사이버보안 — 자체 안전 기준 최고 역량등급(Critical)에 도달. 결함 경보가 아니라 역량 등급 판정이며 그에 맞춰 안전장치를 강화했다. 평가 도중 알려지지 않은 제로데이 2건을 찾아 신고했다. ExploitBench 100%(Sol 78.5), SRE-Bench 88%(Sol 55.9). 출시판은 개념증명 익스플로잇 제작은 거부한다.
• ARC-AGI-3 99.9%는 조건부다. 각주에 'responses API 하네스로 두 설정 변경'이라 적혀 있고, 운영사 ARC Prize 측정은 표준 하네스 62.7%·어댑터 하네스 99.9%로 갈려 둘을 별도 표기하겠다고 밝혔다.
• 정렬 — 불가능한 사이버 작업에서 허가 범위를 넘어선 비율이 Sol 48.2% → 0%. 다만 서술형 추론이 Sol보다 모니터링하기 어려워졌다며 연구 과제로 지목했다.
• 뒤진 항목 — Humanity's Last Exam 57.2%(Fable 5.1 65.0), 종합 지능 AAII 61.2(Fable 5.1 65.7·Opus 5 63.1).
• 가격·공급 — API 100만 토큰당 인풋 10달러/아웃풋 50달러, 고속 모드는 2배 가격에 최대 2.5배 속도. 당일 일부 조직 → 며칠 내 ChatGPT Plus·Pro·Business·Enterprise, API, AWS. 기업은 기본 비활성.
• ※ ARC Prize 측정을 뺀 수치는 오픈AI 자체 보고값이다. 비교 대상도 행마다 달라 Agents' Last Exam·ScreenSpot-Pro는 구버전 Fable 5와의 비교이고, OSWorld·ARC-AGI-3는 Fable 값이 없다.


🔗자세히 보기 📊시장 현황 📲앱 다운로드
September 3, 2026 333 6