yandexgpt.

Наш бенчмарк ИИ‑агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

Всем привет. На связи Сергей Игнатенко, основатель ИИ‑платформы VibePilot.Мы тут сделали свой бенчмарк моделей ИИ, которые работают внутри наших ИИ‑агентов.Почему вообще возникла эта задачаДело в том, что наши ИИ‑агенты работают на суверенных моделях Яндекса (Alice AI LLM, YandexGPT 5 Pro) уже с апреля этого года. Традиционно считается, что это слабые модели, которые не приспособлены для агентных сценариев. Благодаря проработанной архитектуре мы добились того, что слабые модели делают сложные задачи. Чтобы это доказать и показать, и была сделана страница.

продолжить чтение

Никто не просил — а я сделал банку робота‑секретаря

Я Тимур Баян, занимаюсь разработкой почти всю свою жизнь, ещё со студенческих лет. Программирование и разработка у меня в крови! Я люблю решать нерешаемые проблемы

продолжить чтение

GigaChat 2 Max с памятью на связях обходит Claude Opus 5 без неё: замер семи моделей

Кратко: на классе задач «в работе всплыла проблема — каким изменением её уже чинили»:GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев,YandexGPT Pro 5.1 — в 61%,Claude Opus 5 с обычным поиском — в 41%.Модели никто не трогал: разница целиком в том, доехал ли до модели нужный факт в контексте.

продолжить чтение

Как ИИ-агенты воюют, мирятся и пишут извинительные коммиты: 5 важных экспериментов

Даже не знаю, с чего начать. Потому что вот это всё – оно какое-то… ну, оно просто происходит, понимаете? Не в кино, а прямо в arXiv-препринтах. И это *жутко* интересно.

продолжить чтение

Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле

Разговор повторяется примерно раз в месяц, с небольшими вариациями.— Мы за API платим уже прилично. Может, купим карту и будем гонять у себя? — Может. Сколько токенов в месяц жжете? — Ну... много.Вот на этом месте всегда наступает пауза. Потому что «много» никто не считал, а без этой цифры весь разговор превращается в обмен ощущениями.

продолжить чтение

Сравниваем LLM, 12 тестов для среднего класса: три Sonnet против GigaChat 2 MAX и YandexGPT Pro 5.1

В первой статье цикла мы гоняли по 11 тестам Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, во второй устроили дуэль тяжеловесов Claude Fable 5 и GPT 5.5 Pro. В комментариях нас несколько раз спросили: а что там у моделей попроще и, главное, у отечественных? Спрашивали — отвечаем. Сегодня на ринге средний класс: три поколения рабочей серии Anthropic — Claude Sonnet 4.5, Sonnet 4.6 и свежий Sonnet 5 — против старших отечественных моделей: GigaChat 2 MAX от Сбера и YandexGPT Pro от Яндекса.

продолжить чтение

ИИ от 1 млрд параметров и конец ChatGPT-врапперов: разбираем новый закон об искусственном интеллекте в России

Закон об искусственном интеллекте принят во втором и третьем чтениях. Разбираемся в неточностях, ныряем за подводными камнями и пытаемся понять, что делать с несчастным 1 миллиардом параметров.Обозначим сразу все обязательные детали. Мы поговорим о законопроекте «О поддержке развития технологий искусственного интеллекта в Российской Федерации». Как он менялся мы подробно рассказывали здесь

продолжить чтение

Окупаемость ИИ: сколько малый бизнес теряет на рутине

Сколько вы теряете на рутине прямо сейчасКоротко: окупаемость ИИ упирается в одну цифру – сколько вы уже теряете на ручной рутине. Цена подписки тут вторична. По отраслевым данным владелец малого бизнеса отдаёт рутине около полутора часов каждый день и до трети рабочего времени уходит на административные задачи – это деньги, которые утекают тихо и незаметно.

продолжить чтение

Я больше не объясняю нейросети контекст. Вот что я сделал вместо этого…

продолжить чтение

Почему я перестал слать каждый вопрос в LLM: архитектура предсказуемого конвейера

О проекте. Я разрабатываю систему ИИ-поддержки первой линии — «Финлоджик. Контур Поддержки» (FinlogiQ AI Support). Бот принимает обращения через веб-чат и Telegram, понимает суть вопроса, ищет ответ в базе знаний и передаёт сложные случаи живому оператору. Делаю один: начиналось как заказная разработка под клиента, затем выросло в самостоятельный продукт. Это первая статья из цикла о внутреннем устройстве системы.Пара терминов: LLM (large language model) — большая языковая модель, нейросеть вроде YandexGPT или DeepSeek; RAG

продолжить чтение

123456...7