Речь идет о бенчмарке ARC-AGI-3. Он должен проверять, насколько ИИ соображает как человек. Если прошлая версия GPT вытягивала где-то 8%, то у GPT-6 Astra почти 99%.
Это почти паритет с человеческим разумом в одной из самых сложных задач для ИИ.
Сэм Альтман явно знает что-то, чего не знаем мы





