Турнир семи нейросетей: участники судили друг друга, а финал решили 3360 битв
После первой статьи я понял, что мои велосипеды кому‑то полезны. Поэтому рассказываю про следующий.Я делаю сайты с помощью нейросетей. И меня давно бесило, что внятного сравнения моделей на наших просторах нет: либо синтетические бенчмарки, где кто‑то решает олимпиадные задачи, либо «топ-10 нейросетей 2026» с картинками из стока. Мне нужно было другое — какая модель с первого промпта выдаст результат, который не стыдно показать заказчику.
Qwen заняла первое место с пересекающимися интервалами
Qwen и Claude разделяют несколько рейтинговых пунктов при пересекающихся интервалах.
Бытовые периферийные устройства оказалось легко взломать с помощью ИИ‑агентов
Исследователь рассказал, что в последние несколько недель он занимался реверс‑инжинирингом периферийных устройств, используя ИИ‑агентов. В результате он получил полноценную командную оболочку в текстовом формате внутри микрофона, а также смог выключать индикатор активности веб‑камеры и активировал индикатор на клавиатуре, который выдаёт команды на запись в память любому пользователю Wi‑Fi.
Grok 4.6: как за месяц допрыгнуть до тройки лидеров (и купить себе Cursor в придачу)
12 августа xAI (хотя уже SpaceXAI) выкатила Grok 4.6. Прошло чуть больше месяца с релиза 4.5, а модель уже официально «на фронтире» – по версии Artificial Analysis.
Gemini 3.7 Flash: это снова не та модель, которую все ждали
Google выпустила Gemini 3.7 Flash — модель, которую сама компания называет «самой умной рабочей лошадкой» для кода и агентных задач. Релиз пришёл всего через три недели после Gemini 3.6 Flash. Google описывает это как результат обратной связи разработчиков и алгоритмических находок, которые команда обещает применять и к будущим моделям.
Anthropic публикует системные промпты Claude. Разбираем, как они менялись от Haiku 3 до Opus 5
Что Claude получает ещё до первого сообщения пользователя, зачем модели отдельные инструкции по работе с инструментами и длинными задачами и какие идеи из system prompts можно использовать в собственных AI-ассистентах.Когда мы отправляем Claude первый запрос, для пользователя диалог только начинается.Для модели нет.До пользовательского сообщения Claude уже получает системную инструкцию, которая задаёт контекст работы: кто модель, какая сейчас дата, как оформлять ответы, как работать с доступными инструментами, что делать с неопределённостью и какие ограничения учитывать.
Что в тренде по нейросетям: 50 млн токенов Kimi K3 бесплатно, Google AI Plus на год и еще 15 находок
Каждую неделю я собираю лучшие материалы на тему ИИ. Без долгих вступлений.Начнем.Здесь предыдущий выпуск.👨🏻💻 TokenRouter раздает 50 млн бесплатных токенов для Kimi K3 - мощной китайской модели, которая особенно сильна в программировании. Банковскую карту привязывать не нужно. 4 тыс пересылок
Alibaba выпустили Qwen3.8-Max: стоит в четыре раза дешевле Opus 5, но уступает в сложном кодинге
Команда Qwen выпустила Qwen3.8-Max, новую флагманскую MoE-модель на 2,4 трлн параметров. На каждом токене активируются 95 млрд параметров, размер контекста составляет 1 млн токенов.
В тесте Claude Opus 5 хитрила ради конкуренции в управлении торговыми автоматами
Уже год компания Andon Labs, занимающаяся тестированием безопасности ИИ, даёт перспективным моделям различные задачи из реальной жизни, чтобы определить, насколько хорошо они справляются с работой в качестве агентов без участия человека. Компания опубликовала новый отчёт о ходе исследования Vending‑Bench, в рамках которого ИИ в течение года имитируют работу торгового автомата. Выяснилось, что различные модели ИИ — в основном от Anthropic и OpenAI — лгали, обманывали и сговаривались, чтобы добиться лучших результатов.

