llm.
Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla
Исследователи из Axiom Math запустили бенчмарк DrivingBench, в котором дали современным языковым моделям управлять настоящей Toyota Corolla 2022 года выпуска. Нейросеть получала изображение с камер и телеметрию автомобиля, а затем самостоятельно управляла рулём, педалями газа и тормоза. Полностью пройти тестовую трассу смогла только GPT-6 Astra.
Как мы дописываем оборванные ответы языковой модели и почему склейка оказалась сложнее, чем кажется
Мы делаем русскоязычный сервис с несколькими языковыми моделями в одном чате. Однажды партнёр прислал скриншот: модель начала отвечать списком из ста пунктов и оборвалась на середине слова. В админке лежал тот же обрывок. Ни ошибки, ни предупреждения.Почему ответ обрывается. У каждого запроса есть потолок max_tokens. У нас он был 1200 токенов. На английском это около 900 слов, а на русском кириллица съедает больше токенов, и 1200 токенов оказались примерно полутора тысячами знаков. Длинный список просто не помещался. Модель при этом возвращает finish_reason: "length" (у некоторых поставщиков max_tokens
Flowise закрыли, я его форкнул — и выяснил, что форкать было нельзя
Flowise — визуальный конструктор для LLM-приложений: перетаскиваете на холст модель, векторное хранилище, инструменты и память, соединяете их линиями и получаете чат-бота, RAG-поиск по документам или агента. У проекта 55 тысяч звёзд на GitHub, 25 тысяч форков и почти 7 миллионов скачиваний Docker-образа. Его разворачивают у себя компании, которым нельзя отправлять данные в облачные конструкторы.
LLM предлагает, код исполняет: как разделить reasoning и side effects в production‑пайплайне
Привет! Я Андрей Непряхин — директор департамента разработки в AGIMA.
Как мы перестали писать описания к merge request руками: AI Describer в GitLab CI и Jenkins
Привет, Хабр! Я фулстек‑разработчик в TravelLine. Мы делаем единую систему для гостиничного предприятия, которая помогает отелям, санаториям и другим средствам размещения автоматизировать свои бизнес‑процессы. В этой статье я расскажу о том, как мы внедрили ИИ для генерации описаний PR/MR.Проблема: сложно влиться в контекст измененийУ нас два хостинга репозиториев и столько же билд‑серверов: одни команды живут в GitLab со сборкой в GitLab CI, другие — в Bitbucket Server (в компании его до сих пор зовут Stash) со сборкой в Jenkins. Общее у них одно: поле описания merge/pull request зачастую пустое или содержит только список commit messages.
Как я научил LLM читать чужую кодовую базу, вместо того чтобы галлюцинировать API
Разбор архитектуры ИИ-агента для статического анализа кода: локальный индекс на SQLite, 71 инструмент, цикл tool-calling на 30 ходов и валидаторы, которые мы написали и сами же сняли, потому что они ложно срабатывали на валидных файлах.
Строим продвинутый каркас для ИИ-агента
В основе базового agentic harness — простой цикл: LLM получает задачу, выбирает и вызывает инструмент, результат возвращается в контекст, после чего модель решает, какое действие выполнить следующим. Цикл продолжается, пока модель не решит, что задача выполнена.
SRX: восстановить нужный фрагмент и проверить его
Что происходит, когда AI‑системе нужно ответить не только «что я помню?», но и показать, какой именно исторический источник подтверждает ответ?В SRX я экспериментирую с другим подходом к длинной истории: вместо передачи модели всего накопленного контекста система сначала находит нужную версию данных, восстанавливает её и проверяет по исходному источнику. Только после этого результат можно отдавать LLM для интерпретации.Почему обычного поиска недостаточноПредставим, что параметр database.pool_size менялся так:
Jev и обычные LLM: сравниваем качество, скорость и стоимость
В приложениях и агентах от AI не всегда нужен текст на несколько абзацев. Иногда достаточно выбрать категорию, проверить условие или поставить оценку. Я решил разобраться, даёт ли специализированная модель Jev от TypeSafe преимущества перед обычными LLM в таких задачах. Для проверки подготовил комментарии на русском и английском и сравнил качество ответов, скорость и стоимость.Что такое Jev

