sota.

Бенчмарки врут? Бизнес мигрирует на открытые веса, а FDA и ФЗ заставляют уходить на свой инференс: ML-дайджест

продолжить чтение

Конец арендованного интеллекта

Представьте себе биологический вид, который не отрастил собственную префронтальную кору из-за недостатка доступных ресурсов и начал арендовать разумность у более крупного и агрессивного хищника. На короткой дистанции это триумф: нулевой расход калорий на поддержание нейронных связей, блестящее решение рутинных задач и почти бесплатное доминирование в своей экологической нише. Зачем тратить ресурсы на развитие собственного мозга, если можно просто отправлять запросы в чужой? Минус в том, что однажды хищник проголодается, и тогда он вас съест.

продолжить чтение

Zoom AI ворвалась в гонку ИИ-моделей

Технический директор Zoom сообщил о важном достижении в области искусственного интеллекта. Он объявил о том, что Zoom достиг нового передового результата (SOTA) в сложном тесте Humanity's Last Exam (HLE) с полным набором тестов, набрав 48,1%, что представляет собой существенное улучшение на 2,3%

продолжить чтение

Китайцы снова сделали это: MiniMax-M2 — новая SOTA в опенсорсе для кодинга

Внезапно, но факт: свежая MiniMax-M2 от китайской команды MiniMaxAI догнала Grok 4 Fast и Gemini 2.5 Pro. MoE-модель с всего 10B активных параметров обошла многих топ-игроков — от Claude до Gemini и GLM.

продолжить чтение

Вышла новая китайская модель LongCat-Flash-Thinking

продолжить чтение

Разбираемся, как устроена R1 – новая бесплатная ризонинг модель ИИ из Китая, работающая на уровне o1 от OpenAI

Вчера, 20 января, китайская лаборатория DeepSeek сделала нам всем настоящий подарок, открыв доступ к новой reasoning-модели R1, которая уже штурмует вершины ML-бенчмарков. R1 – не просто еще одна рассуждающая модель: это первая бесплатная моделька с открытыми весами, которая добивается таких результатов. На математическом бенчмарке AIME 2024 она достигает 79.8%, обогнав даже обновленную версию o1 с ее 79.2%, не говоря уже об o1-mini (63.6%). В кодинге R1 тоже хороша. Например, на Codeforces ее результат – 96.3%, что практически недостижимо для большинства людей.

продолжить чтение

Обзор уязвимостей для LLM. Часть 1. Атака

Большие языковые модели где только не применяют: генерируют внешний вид автомобилей, домов и кораблей, саммаризируют круглые столы и конференции, придумывают тезисы к статьям, рассылкам и презентациям. Но при всех «плюшках» от внедрения ИИ, не стоит забывать про безопасность. Большие языковые модели атакуют разнообразными изощрёнными способами. В топе новостей о нейросетях — многомиллионные инвестиции в средства защиты от промпт-инъекций. Поэтому поговорим о том, какие угрозы существуют и почему инвесторы платят большие деньги за создание таких бизнесов. А во второй части статьи расскажу, как от них защищаться.

продолжить чтение