FrontierMath.

OpenAI выпустила GPT-6 Astra: кибербезопасность, AGI и доступ

OpenAI представила GPT-6 Astra — новое флагманское поколение модели, ориентированное на автономную работу над сложными многошаговыми задачами. Акцент сделали на программировании, исследованиях, работе с инструментами и других сценариях, где модель должна не просто ответить на запрос, а самостоятельно пройти длинную цепочку действий.Скажу сразу: это скорее поэтапное развертывание. Сначала доступ для избранных — ограниченные группы и спецы по кибербезопасности. Широкий доступ еще не выкатили.

продолжить чтение

Разбираем 14 самых популярных бенчмарков для LLM

Opus 4.5 набирает 80.6% на SWE-bench Verified. Opus 4 — 72.5%. Значит ли это, что Opus 4.5 лучше программирует, чем Opus 4?Ну... возможно. Но SWE-bench Verified это не показывает. Он показывает способность модели чинить небольшие баги в 12 популярных open source Python-репозиториях, которые почти наверняка входят в её обучающие данные. SWE-bench Verified не тестирует умение ориентироваться в вашем TypeScript-монорепо, Spring Boot-приложении или самописном ORM, на котором настоял предыдущий CTO.

продолжить чтение

Когда нейросеть решит то, что не решил никто?

В середине 2024 года GPT-4 спотыкался на школьных задачах, а к концу 2025-го модели щёлкали олимпиадные как орехи. Полтора года, и мы преодалели дистанцию от «найди икс» до «докажи теорему». Epoch AI решили заглянуть еще дальше

продолжить чтение