llm. - страница 12

llm.

Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla

Исследователи из Axiom Math запустили бенчмарк DrivingBench, в котором дали современным языковым моделям управлять настоящей Toyota Corolla 2022 года выпуска. Нейросеть получала изображение с камер и телеметрию автомобиля, а затем самостоятельно управляла рулём, педалями газа и тормоза. Полностью пройти тестовую трассу смогла только GPT-6 Astra.

продолжить чтение

Как мы дописываем оборванные ответы языковой модели и почему склейка оказалась сложнее, чем кажется

Мы делаем русскоязычный сервис с несколькими языковыми моделями в одном чате. Однажды партнёр прислал скриншот: модель начала отвечать списком из ста пунктов и оборвалась на середине слова. В админке лежал тот же обрывок. Ни ошибки, ни предупреждения.Почему ответ обрывается. У каждого запроса есть потолок max_tokens. У нас он был 1200 токенов. На английском это около 900 слов, а на русском кириллица съедает больше токенов, и 1200 токенов оказались примерно полутора тысячами знаков. Длинный список просто не помещался. Модель при этом возвращает finish_reason: "length" (у некоторых поставщиков max_tokens

продолжить чтение

Flowise закрыли, я его форкнул — и выяснил, что форкать было нельзя

Flowise — визуальный конструктор для LLM-приложений: перетаскиваете на холст модель, векторное хранилище, инструменты и память, соединяете их линиями и получаете чат-бота, RAG-поиск по документам или агента. У проекта 55 тысяч звёзд на GitHub, 25 тысяч форков и почти 7 миллионов скачиваний Docker-образа. Его разворачивают у себя компании, которым нельзя отправлять данные в облачные конструкторы.

продолжить чтение

LLM предлагает, код исполняет: как разделить reasoning и side effects в production‑пайплайне

Привет! Я Андрей Непряхин — директор департамента разработки в AGIMA.

продолжить чтение

Как мы перестали писать описания к merge request руками: AI Describer в GitLab CI и Jenkins

Привет, Хабр! Я фулстек‑разработчик в TravelLine. Мы делаем единую систему для гостиничного предприятия, которая помогает отелям, санаториям и другим средствам размещения автоматизировать свои бизнес‑процессы. В этой статье я расскажу о том, как мы внедрили ИИ для генерации описаний PR/MR.Проблема: сложно влиться в контекст измененийУ нас два хостинга репозиториев и столько же билд‑серверов: одни команды живут в GitLab со сборкой в GitLab CI, другие — в Bitbucket Server (в компании его до сих пор зовут Stash) со сборкой в Jenkins. Общее у них одно: поле описания merge/pull request зачастую пустое или содержит только список commit messages.

продолжить чтение

Как я научил LLM читать чужую кодовую базу, вместо того чтобы галлюцинировать API

Разбор архитектуры ИИ-агента для статического анализа кода: локальный индекс на SQLite, 71 инструмент, цикл tool-calling на 30 ходов и валидаторы, которые мы написали и сами же сняли, потому что они ложно срабатывали на валидных файлах.

продолжить чтение

Строим продвинутый каркас для ИИ-агента

В основе базового agentic harness — простой цикл: LLM получает задачу, выбирает и вызывает инструмент, результат возвращается в контекст, после чего модель решает, какое действие выполнить следующим. Цикл продолжается, пока модель не решит, что задача выполнена.

продолжить чтение

Почему RAG не умеет в Excel

Треть нашей базы знаний лежит в выгрузках Excel, и на них ИИ-ассистент отвечает хуже всего. Разбираем, что теряется по дороге от ячейки до индекса.Вопрос, на который ассистент не отвечаетУ нас внутренний помощник по методологии. Он ищет по базе из нескольких сотен документов: регламенты в PDF, презентации, записки и примерно треть корпуса в Excel. Справочники категорий, прайс-листы, списки контрагентов. Всё это мы порезали на куски и сложили в векторный индекс, тридцать пять тысяч кусков.Сотрудник спрашивает: «Является ли Северянка нашим партнёром?»

продолжить чтение

SRX: восстановить нужный фрагмент и проверить его

Что происходит, когда AI‑системе нужно ответить не только «что я помню?», но и показать, какой именно исторический источник подтверждает ответ?В SRX я экспериментирую с другим подходом к длинной истории: вместо передачи модели всего накопленного контекста система сначала находит нужную версию данных, восстанавливает её и проверяет по исходному источнику. Только после этого результат можно отдавать LLM для интерпретации.Почему обычного поиска недостаточноПредставим, что параметр database.pool_size менялся так:

продолжить чтение

Jev и обычные LLM: сравниваем качество, скорость и стоимость

В приложениях и агентах от AI не всегда нужен текст на несколько абзацев. Иногда достаточно выбрать категорию, проверить условие или поставить оценку. Я решил разобраться, даёт ли специализированная модель Jev от TypeSafe преимущества перед обычными LLM в таких задачах. Для проверки подготовил комментарии на русском и английском и сравнил качество ответов, скорость и стоимость.Что такое Jev

продолжить чтение