llm.
Дешевая LLM в проде: как мы ушли с прогнозных $2000 в месяц на $30 и какие минусы
Каждую ночь у нас в JobPath запускается Celery-задача, которая берёт свежие вакансии из каталога (мы собираем их из открытых источников и Telegram-каналов) и превращает сырой текст в структурированную карточку. Изначально это делала Claude Sonnet, и делала отлично. Проблема была в цене: по прогнозу на наш объём выходило около двух тысяч долларов в месяц, и цифра росла вместе с каталогом.
Браузер вместо API: как я объединил DeepSeek, Qwen и ChatGPT в одного локального агента
Под капотом AI Free: три разных способа работы с веб-провайдерами, единый агентный рантайм, память, skills и много кода восстановления после сбоев.У веб-версий больших языковых моделей есть странное свойство: для человека они доступны в один клик, а для программы между «отправить вопрос» и «получить ответ» внезапно вырастает целая инфраструктура.
Qwen3.8 обещают почти на уровне Claude. Но бенчмарков пока нет
Alibaba показала Qwen3.8-Max-Preview, новую флагманскую модель на 2,4 трлн параметров. Компания обещает вскоре открыть веса и называет Qwen3.8 одной из самых мощных моделей на рынке, уступающей только Claude Fable 5.Звучит как прямой ответ на Kimi K3, которая вышла несколькими днями ранее. Но между двумя анонсами есть разница. У Kimi уже появились результаты в Arena и профильных тестах, а у Qwen3.8 пока нет публичной таблицы бенчмарков и полноценной карточки модели.Разберёмся, что Alibaba действительно выпустила, как сейчас попробовать Qwen3.8 и почему с выводами о её месте среди лучших моделей стоит подождать.1. Что именно выпустила Alibaba
ИИ-агент работает, пока ему не дали доступ к реальным данным. Что ломается в проде?
На стенде ИИ-агенту легко быть умным. Все, что нужно для ответа, уже положили в контекст, а реальные системы оставили за пределами демо. В компании ему придется самому получать актуальные сведения из CRM, старой банковской системы, внутренних документов и сервисов. Для этого агенту выдают учетные данные и инструменты, то есть превращают его из чат-интерфейса в участника корпоративной системы. И только тогда выясняется: успешный пилот проверил возможности модели, но ничего не сказал о системе, которая должна снабжать ее данными, ограничивать и контролировать.
Исследование: Claude Code отправляет в 4,7 раза больше служебных токенов, чем OpenCode
Компания Systima сравнила объём служебных данных, которые Claude Code и OpenCode передают языковой модели вместе с пользовательским запросом. Решение от Anthropic использует в 4,7 раза больше токенов и быстрее расходует лимит.
Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля
В октябре 2025-го Андрей Карпатый выложил nanochat — «лучший ChatGPT, который можно купить за $100»: полный пайплайн от токенизатора до веб-чата, четыре часа на арендованной ноде. Еще в декабре 2024-го DeepSeek опубликовал техотчет V3 с цифрой $5,576 млн за обучение. А в конце января 2025-го, на волне выхода R1, заголовки «китайцы сделали GPT-4 за шесть миллионов» несколько дней трясли и прессу, и биржу. А два дня назад прямо здесь, на Хабре, вышла habrGPT — модель 0.5B, обученная с нуля на статьях Хабра на одной RTX 5090, с претрейном за ~6 часов.
MCP Gateway: когда инструменты перестают быть интеграцией и становятся архитектурой
Привет, Хабр! Меня зовут Илья Гуляев, я работаю в команде Рег.облака над облачными решениями

