Наш бенчмарк ИИ‑агентов: собачьи бега моделей LLM, в которых Алиса выигрывает
Всем привет. На связи Сергей Игнатенко, основатель ИИ‑платформы VibePilot.Мы тут сделали свой бенчмарк моделей ИИ, которые работают внутри наших ИИ‑агентов.Почему вообще возникла эта задачаДело в том, что наши ИИ‑агенты работают на суверенных моделях Яндекса (Alice AI LLM, YandexGPT 5 Pro) уже с апреля этого года. Традиционно считается, что это слабые модели, которые не приспособлены для агентных сценариев. Благодаря проработанной архитектуре мы добились того, что слабые модели делают сложные задачи. Чтобы это доказать и показать, и была сделана страница.
Турнир семи нейросетей: участники судили друг друга, а финал решили 3360 битв
После первой статьи я понял, что мои велосипеды кому‑то полезны. Поэтому рассказываю про следующий.Я делаю сайты с помощью нейросетей. И меня давно бесило, что внятного сравнения моделей на наших просторах нет: либо синтетические бенчмарки, где кто‑то решает олимпиадные задачи, либо «топ-10 нейросетей 2026» с картинками из стока. Мне нужно было другое — какая модель с первого промпта выдаст результат, который не стыдно показать заказчику.
(Не)видимая цена интеллекта: почему экономия на LLM убивает ваши агентные системы
Разработчики агентных систем оказались в странной ситуации. Модели становятся дешевле, но задачи решают хуже. Провайдеры соревнуются в снижении цены за токен, а команды радостно переходят на облегчённые версии, экономя на вычислениях. Экономия очевидна — до первого столкновения с реальной задачей.
Лаборатория ИИ за 200 000 ₽: как мы собрали локальный ИИ-сервер на 2× Tesla V100
О чём это и зачемПриятно наблюдать за тем, что сообщество людей, работающих с локальными ИИ, растет с каждым днем, но до сих пор я встречаю мнение, как сложно собрать нужное оборудование под свой сервер LLM. В интернете встречаются просто сумасшедшие суммы на сборки под ИИ, хотя все можно сделать гораздо проще, и своими руками. Так и родилась идея сделать обзор на самую бюджетную серверную видеокарту V100 на 16/32 ГБ, приложив 100+ бенчмарков различных моделей, чтобы показать, как за малые средства можно приобрести целую лабораторию дома.
GLM 5.1 vs. DeepSeek V3.2: сравниваем топовые китайские модели
В Veai мы регулярно тестируем и сравниваем модели, которые доступны у нас в плагине. Каждая модель, которую мы добавляем проходит через наш собственный бенчмарк, прежде чем попасть в продакшн. Недавно тестированию подверглись GLM 5.1 и DeepSeek V3.2. Делимся результатами.

