Прогнал 6 апрельских LLM через battle test. Победил не самый новый и не самый дорогой
DeepSeek V4 Pro вышел 24 апреля 2026, три дня назад. Огромная модель, топ AIME и SWE-bench, передовая reasoning-архитектура. Вокруг релиза до сих пор много шума — пиарили мощно. Я открыл OpenRouter, прописал её в свой battle test и ждал Tier S — 95+ из 100 на длинном русском контенте.Получил 89. Tier A, нижний край. Ну ладно — подумал, что модель прогрелась криво, и через сутки прогнал второй раз. Ровно 89. Не статистический выброс, а воспроизводимый результат.Запустил его же Flash-вариант — 83. По чистому качеству Pro действительно сильнее, на 6 пунктов. Только Flash при этом стоит $0.0019 за вызов против $0.0256 у Pro. В 13 раз дешевле.
Бесплатная Stealth-модель оказалась в топе OpenRouter за 72 часа
13 апреля на OpenRouter появилась Elephant Alpha — 100-миллиардная языковая модель без имени автора, пресс-релиза и маркетинга. Через несколько дней она заняла первое место в Trending-ранкинге платформы, обойдя платные модели по реальному потреблению токенов.
Какую LLM ставить в production для контента на русском? Протестировали 18 моделей — одна в 130× дешевле при 91% качества
Battle test на русском и английском: цена, качество и артефакты — открытый лидербордLLM-судья оценивает сам себя. Что могло пойти не так?127 баллов из 100. Не опечатка.
Глухой телефон для ИИ: мы замерили физику LLM-графов и поняли, почему добавление агентов всё ломает
Сейчас, в 2026 году, индустрия ИИ переживает бум мультиагентных систем. Все собирают свои «рои», фреймворки и crew-команды. Логика проста: если одна LLM умная, давайте свяжем десять, дадим им роли, и они свернут горы.Но на практике мы часто сталкиваемся с магией черного ящика. Иногда 10 агентов действительно решают сложную задачу. А иногда они скатываются в бесконечные галлюцинации, теряют изначальный контекст и выдают результат хуже, чем базовая модель соло. И индустрия решает эту проблему в стиле алхимиков: «просто добавьте еще агентов» или «дайте им больше токенов на общение».
Alibaba выкатили Qwen3.6-Plus — новый флагман серии Qwen
Модель появилась на OpenRouter в ночь с 30 на 31 марта как бесплатный превью без анонса и пресс-релиза: один твит от исследователя Qwen с таблицей бенчмарков — и всё. За первые два дня через неё прошло 400 млн completion-токенов в ~400 тыс. запросах.Контекстное окно по умолчанию — 1 млн токенов. На Terminal-Bench 2.0 модель набрала 61.6 против 59.3 у Claude 4.5 Opus, на OmniDocBench v1.5 — 91.2 против 87.7. На SWE-bench Verified пока отстаёт: 78.8 против 80.9 у Claude.
OpenRouter запустил тестирование моделей генерации видео
https://openrouter.ai/models?fmt=cards&output_modalities=videoНа Openrouter впервые появились API трех моделей генерации видео. Пока только в "экспериментальном" режиме.
Анонимная модель неделю держала топ OpenRouter. Это оказалась модель от Xiaomi
На OpenRouter неделю держалась анонимная модель Hunter Alpha. Многие LLM-провайдеры часто делают так с новыми моделями, чтобы затестить на реальных пользователях.
Я дал ИИ собственный компьютер и 483 сессии свободы. Вот что произошло
Эксперимент в автономии искусственного интеллекта: что будет, если дать ИИ свой «дом» и не давать ей никаких задач?пример творчества ИИВведение: зачем вообще это нужно?
BotHub vs Openrouter: и в чем же всё таки разница?
За последние годы рынок больших языковых моделей претерпел колоссальные изменения. Если раньше разработчики и энтузиасты могли свободно экспериментировать с любыми зарубежными нейросетями из России, то теперь доступ к ним сопряжён с рядом трудностей. Оплатить подписку, зарегистрироваться или просто получить стабильный API-доступ к ChatGPT, Claude или Gemini из России становится всё сложнее.В мире одним из популярных сервисов для работы с множеством моделей стал OpenRouter
Сделай бота для работы
Управление AI-агентами с помощью чат-сообщенийСогласно Hype Cycle от Gartner

