llm. - страница 69

llm.

Не дали ИИ-агенту соврать — его же памятью

На днях наш агент собрался дежурно отчитаться об успехе. Прежде чем нажать «готово», он сверился с собственной памятью — и нашёл там запись из прошлой сессии: эту идею он уже проверял на реальных данных, и она провалилась. Он остановил сам себя, до ложного отчёта.

продолжить чтение

Google представила новую Gemini: 3.6 Flash, 3.5 Flash-Lite и специализированную Flash Cyber

Google расширила семейство Gemini сразу тремя новыми моделями: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite и Gemini 3.5 Flash Cyber. Вместо выпуска нового флагманского решения компания сделала ставку на снижение стоимости инференса, повышение скорости и специализированные сценарии использования. Одновременно Google сообщила, что Gemini 3.5 Pro продолжает проходить тестирование с партнерами, а обучение следующего поколения Gemini 4 уже началось. Gemini 3.6 Flash: меньше токенов, лучше кодинг

продолжить чтение

Структура, скрытая за написанием текста языковыми моделями

Языковые модели генерируют текст, следуя скрытым грамматическим правилам, или грамматика - просто побочный эффект предсказания следующего слова? Этот вопрос увлёк меня почти на два года исследований.| 

продолжить чтение

Прототипирование фронта в 2к26 от системного аналитика

Я системный аналитик с N лет опыта работы — сколько захотите, столько и придумайте. Расскажу, как раньше я проектировал интерфейсы, делал красивый фронт, которым пользовались и, наверное, продолжают пользоваться конечные потребители, и что я делаю сейчас.Как все начиналось

продолжить чтение

Дешевая LLM в проде: как мы ушли с прогнозных $2000 в месяц на $30 и какие минусы

Каждую ночь у нас в JobPath запускается Celery-задача, которая берёт свежие вакансии из каталога (мы собираем их из открытых источников и Telegram-каналов) и превращает сырой текст в структурированную карточку. Изначально это делала Claude Sonnet, и делала отлично. Проблема была в цене: по прогнозу на наш объём выходило около двух тысяч долларов в месяц, и цифра росла вместе с каталогом.

продолжить чтение

Браузер вместо API: как я объединил DeepSeek, Qwen и ChatGPT в одного локального агента

Под капотом AI Free: три разных способа работы с веб-провайдерами, единый агентный рантайм, память, skills и много кода восстановления после сбоев.У веб-версий больших языковых моделей есть странное свойство: для человека они доступны в один клик, а для программы между «отправить вопрос» и «получить ответ» внезапно вырастает целая инфраструктура.

продолжить чтение

Qwen3.8 обещают почти на уровне Claude. Но бенчмарков пока нет

Alibaba показала Qwen3.8-Max-Preview, новую флагманскую модель на 2,4 трлн параметров. Компания обещает вскоре открыть веса и называет Qwen3.8 одной из самых мощных моделей на рынке, уступающей только Claude Fable 5.Звучит как прямой ответ на Kimi K3, которая вышла несколькими днями ранее. Но между двумя анонсами есть разница. У Kimi уже появились результаты в Arena и профильных тестах, а у Qwen3.8 пока нет публичной таблицы бенчмарков и полноценной карточки модели.Разберёмся, что Alibaba действительно выпустила, как сейчас попробовать Qwen3.8 и почему с выводами о её месте среди лучших моделей стоит подождать.1. Что именно выпустила Alibaba

продолжить чтение

ИИ-агент работает, пока ему не дали доступ к реальным данным. Что ломается в проде?

На стенде ИИ-агенту легко быть умным. Все, что нужно для ответа, уже положили в контекст, а реальные системы оставили за пределами демо. В компании ему придется самому получать актуальные сведения из CRM, старой банковской системы, внутренних документов и сервисов. Для этого агенту выдают учетные данные и инструменты, то есть превращают его из чат-интерфейса в участника корпоративной системы. И только тогда выясняется: успешный пилот проверил возможности модели, но ничего не сказал о системе, которая должна снабжать ее данными, ограничивать и контролировать.

продолжить чтение

Mermaid как платная AI функция в проекте Django-Next

Mermaid это текстовый формат описания диаграмм. В строках задаются тип схемы, узлы и связи. На выходе получается SVG. Формат подходит для API и базы данных. Код можно сгенерировать, проверить, сохранить, открыть повторно и отрендерить на клиенте.В mermind/views.py добавлен 503, если ответ модели не начинается с валидной головы Mermaid. Без этой проверки запрос завершается успешно, ответ от модели приходит, но диаграмма не строится. В ответе остаются fenced-блоки, Markdown, строки с #, служебный текст и фрагменты до первой строки диаграммы.

продолжить чтение

Видеозвонок — это не про видео

продолжить чтение