llm. - страница 81

llm.

Всё, что вы хотели знать про локальные LLM, но боялись заинференсить

Хардкорный NIAH или почему у Gemma 26B память рыбки, какой Qwen лучше, и что показали 8 моделей на RTX 5090Привет, Хабр.Меня зовут Артём Хакимов, я работаю в команде GPUGO.Большая часть наших пользователей, которая не создаёт ИИ-подружек, работает с LLM — кто-то дообучает, кто-то гоняет инференс. И у всех одни и те же вопросы: «что быстрее?», «сколько контекста влезет?», «какой квант брать?».

продолжить чтение

Системный аналитик 2026: вы всё ещё пишете документацию, но теперь её читает только LLM

❝ — Значит, Ричард написал код? — Ричард написал, но источник вдохновения очевиден. ❞ © Кремниевая долина Я работаю более 6 лет системным аналитиком и порядка трёх лет на продуктах по внедрению LLM в бизнес. И меня категорически не устраивает AI-зрелость большинства моих коллег в этих ИИ-проектах!

продолжить чтение

EventRAG: как научить RAG искать первопричину во времени, а не в тексте

On-prem RCA-ассистент для цеха + AR-HUD. Полный разбор: архитектура, формулы, расчёты, живой инцидент на роботе-паллетайзере Hyundai Hi5-N00 и что мы везём на международную конференциюTL;DR. Обычный RAG отлично отвечает по инструкциям, но проваливается на root-cause-анализе (RCA) в цеху: косинусная близость по эмбеддингам выбрасывает время и причинность — ровно то, без чего нельзя связать «наряд, отложенный 67 дней назад» с «алармом, который встал сегодня». EventRAG — архитектура, которая нормализует каждое событие в Temporal Event Unit, хранит его в двойном индексе (вектор + причинный граф), ищет по времени, обходит граф

продолжить чтение

Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

Привет, Хабр! В сентябре 2024 года Anthropic опубликовала технику Contextual Retrieval с обещанием снизить процент неудачных извлечений в RAG‑системах на 49% при использовании только embeddings и на 67% в сочетании с reranking. К середине 2026 года эта техника закрепилась как один из стандартов production‑RAG и применяется в подавляющем большинстве серьёзных корпоративных систем. Разберём, в чём её суть, почему она вообще работает, как её реализовать и где она ломается.Корневая проблема classical RAG, которую долго игнорировали

продолжить чтение

GigaChat 3.5 — меньше, быстрее, сильнее

Салют, Хабр!Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — нашу новую 432B-модель. В этом релизе мы впервые для нашей линейки масштабировали собственную гибридную архитектуру на сотни миллиардов параметров, ускорили инференс и усилили модель в коде, агентных сценариях и сложных областях.GigaChat 3.5 Ultra компактнее прошлого флагмана: 432 млрд параметров вместо 700 млрд у GigaChat 3.1 Ultra. Но это не компромисс «меньше, зато дешевле»: за счёт новых данных, обновлённого рецепта обучения и архитектурных изменений модель стала сильнее, а также эффективнее по памяти и скорости генерации.Интересно? Добро пожаловать под кат.

продолжить чтение

От REST к MCP: как LLM меняют принципы проектирования API и архитектуры систем. Часть 2

Контекст: эволюция API в эпоху LLMНачнем с самых основ.История API берет начало в 1945-1951 году, когда появляются первые библиотеки подпрограмм и модульный подход к разработке. В это время растет количество программного кода и появл

продолжить чтение

Продакшн на Laravel руками ИИ‑агента: честный отчёт о том, что работает, а что чуть не уронило прод

Я аналитик, а не разработчик. Весь код для созданной нами платформы написал Claude Opus через Claude Code. Рассказываю без хайпа: как выглядит реальный workflow, где нейросеть незаменима, где она бесполезна, и какая инженерная дисциплина обязательна, чтобы это не превратилось в тыкву на боевом. Сразу обозначу рамку, чтобы снять половину вопросов из комментариев.Я не умею писать продакшн‑код. Я аналитик: читаю код, рассуждаю о системах, проектирую поведение — но профессионально не кодю. Тем не менее у нас в проде работает нетривиальное веб‑приложение, и каждую строчку кода написала нейросеть

продолжить чтение

Когда ИИ мониторит ИИ: Полный стек наблюдаемости для LLM

пупупупуПредставьте: вы развернули в своём частном облаке или на локальных серверах Llama 3, DeepSeek или другую LLM. Данные остаются внутри инфраструктуры, модель работает локально, на первый взгляд система полностью здорова: CPU, память, сеть и сами сервисы работают без отклонений.

продолжить чтение

Как мы научили большую языковую модель говорить на карачаево-балкарском

Рис 0. Демо-чатДавно ничего не писал где-либо: разработка занимает много времени. Надеюсь, наш путь будет кому-либо полезен, особенно тем, кто обучает модельки на малоресурсных языках.Большая в данном контексте - это условно. По сути, взяли

продолжить чтение

Почему ChatGPT называет одни бренды и молчит про другие: как машина знает компании

Я изучаю AEO/GEO (продвижение брендов в ответах нейросетей) и наткнулся на разбор про странную вещь: нейросети называют одни бренды и будто не замечают другие, причём качество продукта тут ни при чём (SearchAtlas). Объясняют это через понятие сущности: и поиск, и нейросети воспринимают бренд как отдельный объект знания со своими свойствами и связями.

продолжить чтение