llm. - страница 34

llm.

RAG для закупок: Qdrant и LlamaIndex в локальном контуре

Привет Хабр! Меня зовут Владимир, и недавно я решил изучить новую (для себя) технологию - LlamaIndex. А тут и задачка подвернулась - надоело копаться в Положении о закупках, поэтому понадобился RAG для ответов по ФЗ-44, ФЗ-223, ну и локальному положению.В этой статье разберу, как создать простенький RAG, не выходящий из локального контура, на базе LlamaIndex + Qdrant, напишем к нему API и UI на Gradio. Поехали.Конфигурация проектаДля сервиса понадобятся LLM, векторная БД Qdrant, эмбеддер и реранкер результатов. Сразу код конфигурации:Код конфигурации

продолжить чтение

Сравниваем LLM, 12 тестов для Claude Fable 5 и GPT 5.5 Pro

В прошлой статье мы устроили большое сравнение Opus 4.8, GPT 5.5 и Gemini 3.1 Pro и оговорились: GPT 5.5 Pro в том матче не участвовала, потому что ее корректнее сравнивать с недоступной на тот момент Fable. Что ж, обещания надо выполнять. Anthropic внезапно вернула Claude Fable 5 в общий доступ. Напомню, это первая модель нового класса Mythos, которая в иерархии компании стоит выше Opus. Значит, пришло время дуэли тяжеловесов: Claude Fable 5 против GPT 5.5 Pro.

продолжить чтение

Как я три раза платил за ChatGPT: два раза был отправлен в бан без рефанда, чуть не развелся, и нашёл работающий способ

Не знаю, как у нормальных людей начинаются отношения с искусственным интеллектом. Наверное, они заходят на сайт, нажимают кнопку, вводят карту, получают подписку и идут жить свою счастливую продвинутую иишную житуху.У меня всё было иначе.Мои отношения с ChatGPT начались как хороший роман с плохим концом: сначала восторг, потом отношения, потом внезапное исчезновение денег и фраза "знаешь милый, любовь прошла, завяли помидоры, а твоя страна больше не поддерживается. Гудбай, май лав"!Расставание (два, точнее) обошлись мне в $220. Как это было, сейчас расскажу.

продолжить чтение

Как мы создавали «умный» поиск по регламенту вуза

Сначала — пара слов о себе, иначе непонятно, откуда вообще взялся весь проект. Я преподаю на кафедре информационных технологий в одном из вузов нашего города и при этом больше двадцати лет пишу код не в учебных примерах, а в бою. Эти две роли — преподавателя и практикующего разработчика — в какой-то момент и сошлись в одном небольшом проекте, который я затеял для себя.

продолжить чтение

Reddit использует большие языковые модели для решения проблем LLM

В Reddit разработали инструменты с использованием больших языковых моделей для борьбы со спамом, большая часть которого изначально создавалась с помощью LLM. По данным платформы, ежедневно они блокируют 23 млн спам-просмотров и отлавливают около 25 тысяч новых спам-сообщений и комментариев.

продолжить чтение

Как мы строили свою базу данных о киберугрозах для LLM-агентов и SOC

ВведениеСначала задача звучала просто: складывать PDF, CVE и статьи по кибербезопасности в одну базу, затем давать LLM-агенту подходящие фрагменты через HTTP API. На доске это помещалось в одну цепочку: загрузка, извлечение текста, разбиение на части, построение векторов, поиск.Рабочий прототип появился быстро. Настоящая работа началась потом.

продолжить чтение

Всё, что вы хотели знать про локальные LLM, но боялись заинференсить

Хардкорный NIAH или почему у Gemma 26B память рыбки, какой Qwen лучше, и что показали 8 моделей на RTX 5090Привет, Хабр.Меня зовут Артём Хакимов, я работаю в команде GPUGO.Большая часть наших пользователей, которая не создаёт ИИ-подружек, работает с LLM — кто-то дообучает, кто-то гоняет инференс. И у всех одни и те же вопросы: «что быстрее?», «сколько контекста влезет?», «какой квант брать?».

продолжить чтение

Системный аналитик 2026: вы всё ещё пишете документацию, но теперь её читает только LLM

❝ — Значит, Ричард написал код? — Ричард написал, но источник вдохновения очевиден. ❞ © Кремниевая долина Я работаю более 6 лет системным аналитиком и порядка трёх лет на продуктах по внедрению LLM в бизнес. И меня категорически не устраивает AI-зрелость большинства моих коллег в этих ИИ-проектах!

продолжить чтение

EventRAG: как научить RAG искать первопричину во времени, а не в тексте

On-prem RCA-ассистент для цеха + AR-HUD. Полный разбор: архитектура, формулы, расчёты, живой инцидент на роботе-паллетайзере Hyundai Hi5-N00 и что мы везём на международную конференциюTL;DR. Обычный RAG отлично отвечает по инструкциям, но проваливается на root-cause-анализе (RCA) в цеху: косинусная близость по эмбеддингам выбрасывает время и причинность — ровно то, без чего нельзя связать «наряд, отложенный 67 дней назад» с «алармом, который встал сегодня». EventRAG — архитектура, которая нормализует каждое событие в Temporal Event Unit, хранит его в двойном индексе (вектор + причинный граф), ищет по времени, обходит граф

продолжить чтение

Contextual Retrieval: техника, которая чинит главную проблему RAG за 50 центов на тысячу чанков

Привет, Хабр! В сентябре 2024 года Anthropic опубликовала технику Contextual Retrieval с обещанием снизить процент неудачных извлечений в RAG‑системах на 49% при использовании только embeddings и на 67% в сочетании с reranking. К середине 2026 года эта техника закрепилась как один из стандартов production‑RAG и применяется в подавляющем большинстве серьёзных корпоративных систем. Разберём, в чём её суть, почему она вообще работает, как её реализовать и где она ломается.Корневая проблема classical RAG, которую долго игнорировали

продолжить чтение