llm. - страница 23

llm.

Дешевая LLM в проде: как мы ушли с прогнозных $2000 в месяц на $30 и какие минусы

Каждую ночь у нас в JobPath запускается Celery-задача, которая берёт свежие вакансии из каталога (мы собираем их из открытых источников и Telegram-каналов) и превращает сырой текст в структурированную карточку. Изначально это делала Claude Sonnet, и делала отлично. Проблема была в цене: по прогнозу на наш объём выходило около двух тысяч долларов в месяц, и цифра росла вместе с каталогом.

продолжить чтение

Браузер вместо API: как я объединил DeepSeek, Qwen и ChatGPT в одного локального агента

Под капотом AI Free: три разных способа работы с веб-провайдерами, единый агентный рантайм, память, skills и много кода восстановления после сбоев.У веб-версий больших языковых моделей есть странное свойство: для человека они доступны в один клик, а для программы между «отправить вопрос» и «получить ответ» внезапно вырастает целая инфраструктура.

продолжить чтение

Qwen3.8 обещают почти на уровне Claude. Но бенчмарков пока нет

Alibaba показала Qwen3.8-Max-Preview, новую флагманскую модель на 2,4 трлн параметров. Компания обещает вскоре открыть веса и называет Qwen3.8 одной из самых мощных моделей на рынке, уступающей только Claude Fable 5.Звучит как прямой ответ на Kimi K3, которая вышла несколькими днями ранее. Но между двумя анонсами есть разница. У Kimi уже появились результаты в Arena и профильных тестах, а у Qwen3.8 пока нет публичной таблицы бенчмарков и полноценной карточки модели.Разберёмся, что Alibaba действительно выпустила, как сейчас попробовать Qwen3.8 и почему с выводами о её месте среди лучших моделей стоит подождать.1. Что именно выпустила Alibaba

продолжить чтение

ИИ-агент работает, пока ему не дали доступ к реальным данным. Что ломается в проде?

На стенде ИИ-агенту легко быть умным. Все, что нужно для ответа, уже положили в контекст, а реальные системы оставили за пределами демо. В компании ему придется самому получать актуальные сведения из CRM, старой банковской системы, внутренних документов и сервисов. Для этого агенту выдают учетные данные и инструменты, то есть превращают его из чат-интерфейса в участника корпоративной системы. И только тогда выясняется: успешный пилот проверил возможности модели, но ничего не сказал о системе, которая должна снабжать ее данными, ограничивать и контролировать.

продолжить чтение

Mermaid как платная AI функция в проекте Django-Next

Mermaid это текстовый формат описания диаграмм. В строках задаются тип схемы, узлы и связи. На выходе получается SVG. Формат подходит для API и базы данных. Код можно сгенерировать, проверить, сохранить, открыть повторно и отрендерить на клиенте.В mermind/views.py добавлен 503, если ответ модели не начинается с валидной головы Mermaid. Без этой проверки запрос завершается успешно, ответ от модели приходит, но диаграмма не строится. В ответе остаются fenced-блоки, Markdown, строки с #, служебный текст и фрагменты до первой строки диаграммы.

продолжить чтение

Видеозвонок — это не про видео

продолжить чтение

Исследование: Claude Code отправляет в 4,7 раза больше служебных токенов, чем OpenCode

Компания Systima сравнила объём служебных данных, которые Claude Code и OpenCode передают языковой модели вместе с пользовательским запросом. Решение от Anthropic использует в 4,7 раза больше токенов и быстрее расходует лимит. 

продолжить чтение

Данные, которые нельзя выдумать: как мы собираем трейсы для тренировки агентских навыков Cotype

продолжить чтение

Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля

В октябре 2025-го Андрей Карпатый выложил nanochat — «лучший ChatGPT, который можно купить за $100»: полный пайплайн от токенизатора до веб-чата, четыре часа на арендованной ноде. Еще в декабре 2024-го DeepSeek опубликовал техотчет V3 с цифрой $5,576 млн за обучение. А в конце января 2025-го, на волне выхода R1, заголовки «китайцы сделали GPT-4 за шесть миллионов» несколько дней трясли и прессу, и биржу. А два дня назад прямо здесь, на Хабре, вышла habrGPT — модель 0.5B, обученная с нуля на статьях Хабра на одной RTX 5090, с претрейном за ~6 часов.

продолжить чтение

MCP Gateway: когда инструменты перестают быть интеграцией и становятся архитектурой

Привет, Хабр! Меня зовут Илья Гуляев, я работаю в команде Рег.облака над облачными решениями

продолжить чтение

1...10...212223242526...3040...320