llm.
Всё, что вы хотели знать про локальные LLM, но боялись заинференсить
Хардкорный NIAH или почему у Gemma 26B память рыбки, какой Qwen лучше, и что показали 8 моделей на RTX 5090Привет, Хабр.Меня зовут Артём Хакимов, я работаю в команде GPUGO.Большая часть наших пользователей, которая не создаёт ИИ-подружек, работает с LLM — кто-то дообучает, кто-то гоняет инференс. И у всех одни и те же вопросы: «что быстрее?», «сколько контекста влезет?», «какой квант брать?».
Системный аналитик 2026: вы всё ещё пишете документацию, но теперь её читает только LLM
❝ — Значит, Ричард написал код? — Ричард написал, но источник вдохновения очевиден. ❞ © Кремниевая долина Я работаю более 6 лет системным аналитиком и порядка трёх лет на продуктах по внедрению LLM в бизнес. И меня категорически не устраивает AI-зрелость большинства моих коллег в этих ИИ-проектах!
EventRAG: как научить RAG искать первопричину во времени, а не в тексте
On-prem RCA-ассистент для цеха + AR-HUD. Полный разбор: архитектура, формулы, расчёты, живой инцидент на роботе-паллетайзере Hyundai Hi5-N00 и что мы везём на международную конференциюTL;DR. Обычный RAG отлично отвечает по инструкциям, но проваливается на root-cause-анализе (RCA) в цеху: косинусная близость по эмбеддингам выбрасывает время и причинность — ровно то, без чего нельзя связать «наряд, отложенный 67 дней назад» с «алармом, который встал сегодня». EventRAG — архитектура, которая нормализует каждое событие в Temporal Event Unit, хранит его в двойном индексе (вектор + причинный граф), ищет по времени, обходит граф
GigaChat 3.5 — меньше, быстрее, сильнее
Салют, Хабр!Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — нашу новую 432B-модель. В этом релизе мы впервые для нашей линейки масштабировали собственную гибридную архитектуру на сотни миллиардов параметров, ускорили инференс и усилили модель в коде, агентных сценариях и сложных областях.GigaChat 3.5 Ultra компактнее прошлого флагмана: 432 млрд параметров вместо 700 млрд у GigaChat 3.1 Ultra. Но это не компромисс «меньше, зато дешевле»: за счёт новых данных, обновлённого рецепта обучения и архитектурных изменений модель стала сильнее, а также эффективнее по памяти и скорости генерации.Интересно? Добро пожаловать под кат.
От REST к MCP: как LLM меняют принципы проектирования API и архитектуры систем. Часть 2
Контекст: эволюция API в эпоху LLMНачнем с самых основ.История API берет начало в 1945-1951 году, когда появляются первые библиотеки подпрограмм и модульный подход к разработке. В это время растет количество программного кода и появл
Продакшн на Laravel руками ИИ‑агента: честный отчёт о том, что работает, а что чуть не уронило прод
Я аналитик, а не разработчик. Весь код для созданной нами платформы написал Claude Opus через Claude Code. Рассказываю без хайпа: как выглядит реальный workflow, где нейросеть незаменима, где она бесполезна, и какая инженерная дисциплина обязательна, чтобы это не превратилось в тыкву на боевом. Сразу обозначу рамку, чтобы снять половину вопросов из комментариев.Я не умею писать продакшн‑код. Я аналитик: читаю код, рассуждаю о системах, проектирую поведение — но профессионально не кодю. Тем не менее у нас в проде работает нетривиальное веб‑приложение, и каждую строчку кода написала нейросеть
Когда ИИ мониторит ИИ: Полный стек наблюдаемости для LLM
пупупупуПредставьте: вы развернули в своём частном облаке или на локальных серверах Llama 3, DeepSeek или другую LLM. Данные остаются внутри инфраструктуры, модель работает локально, на первый взгляд система полностью здорова: CPU, память, сеть и сами сервисы работают без отклонений.
Как мы научили большую языковую модель говорить на карачаево-балкарском
Рис 0. Демо-чатДавно ничего не писал где-либо: разработка занимает много времени. Надеюсь, наш путь будет кому-либо полезен, особенно тем, кто обучает модельки на малоресурсных языках.Большая в данном контексте - это условно. По сути, взяли
Почему ChatGPT называет одни бренды и молчит про другие: как машина знает компании
Я изучаю AEO/GEO (продвижение брендов в ответах нейросетей) и наткнулся на разбор про странную вещь: нейросети называют одни бренды и будто не замечают другие, причём качество продукта тут ни при чём (SearchAtlas). Объясняют это через понятие сущности: и поиск, и нейросети воспринимают бренд как отдельный объект знания со своими свойствами и связями.

