llm. - страница 126

llm.

Как мы построили корпоративную LLM-платформу: архитектура, грабли и выводы

Привет! Меня зовут Артём, я руковожу группой цифровой трансформации в Sminex. Последние два года моя команда занимается внедрением AI в компанию. В реальности это куда менее гламурная история, чем звучит: про прокси-слои, отладку промптов в Langfuse и бесконечные «Почему модель опять ответила не то?».В этой статье расскажу, как мы с самого начала пошли в LLM-платформу — а не в «одного бота», почему это было правильным решением и какие грабли мы всё равно собрали по дороге.Почему мы сразу пошли в платформу

продолжить чтение

Как мы в отделе документации создали LLM агента для автоматизированного перевода с английского на другие языки

Автор: Александр Казанцев, руководитель отдела документации и контентаПредставьте, что вы поддерживаете крупный проект с документацией на нескольких языках. Каждый раз, когда в английской версии появляется новое руководство или исправляется ошибка, нужно вручную обновлять все переводы в других языковых версиях. Это дорого, медленно и чревато рассинхронизацией. Даже два дополнительных языка начинают создавать проблему, а если их больше?LLM-модели на вашем сервереЛучшие LLM-модели на профессиональных серверах с GPU-картами

продолжить чтение

Архитектура AI-сервисов: почему монолит убивает latency и GPU

Всем привет, меня зовут Сергей Прощаев, и в этой статье я расскажу про реальную архитектуру ИИ-сервисов, которые выдерживают high-load и отвечают за десятки миллисекунд. Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E-commerce, а ещё преподаю на курсах разработки и архитектуры в OTUS. За моими плечами — несколько проектов, где мы встраивали генеративные модели в прод, и каждый раз одно и то же: на нагрузочном тестировании всё летает, а в проде — латенси скачет, GPU греются, бюджет тает. На недавнем открытом уроке курса «ИИ-архитектор»

продолжить чтение

Как я обучил GPT с нуля на русском языке — и что из этого получилось

Всё началось с наивной мысли: зачем платить за API или тащить 7B-модель, если мне нужна маленькая модель для простых разговоров на одном языке? Логика казалась железной — большие модели умеют всё и на всех языках сразу, но это же избыточно. 0.7B, заточенная под один язык и один стиль общения, должна справляться не хуже.Спойлер: это было наивно. Но путь оказался ценнее результата.В этой статье — как я прошёл путь от стандартного nanoGPT до кастомной архитектуры с RoPE/SwiGLU/GQA, собрал русскоязычный корпус с нуля, и придумал распределённое обучение на бесплатных Colab-воркерах через Google Drive.Почему не взять готовую модель?

продолжить чтение

ИИ-агенты за пределами чат-бота: платформа, мультиагентность, безопасность и путь в прод — новый выпуск подкаста ГНИВЦ

ИИ-агенты в проде — не игрушка, а архитектура. Подкаст ГНИВЦВышел новый выпуск подкаста ГНИВЦ, посвящённый теме, которая окончательно вышла из лабораторий в продакшен

продолжить чтение

RAG для тех, кто разочаровался: почему retrieval ломается и как это починить

Вы собрали RAG-пайплайн: загрузили документы, нарезали на чанки, сгенерировали эмбеддинги, подключили векторную базу. Задаёте вопрос — модель отвечает уверенно и подробно. Показываете заказчику, тот в восторге. Потом начинается тестирование на реальных вопросах, и оказывается, что на половину из них система отвечает мимо: то находит не тот документ, то находит правильный, но не тот кусок, то вообще ничего релевантного не достаёт и модель уверенно галлюцинирует.

продолжить чтение

Как я Zabbix с LLM дружил в свободное время. Архитектурный обзор взаимодействия с нейросетью. Часть 3 HLD и немного LLD

Лапки котику помогли!

продолжить чтение

Каким должен быть язык программирования, чтобы с ним хорошо работали AI-агенты

В прошлом году я впервые задумался о том, как может выглядеть будущее языков программирования теперь, когда агентная разработка становится все более заметным явлением. Сначала мне казалось, что огромный корпус уже существующего кода закрепит нынешние языки на своих местах, но теперь я начинаю думать, что верно обратное.

продолжить чтение

Почему Qwen3.6-27B лучше чем Claude? Железная коробка, которая научилась думать

На вопрос «Чем локальная модель лучше коммерческой top‑quality модели от Anthropic, OpenAI или Google?», — обычно отвечают: приватность. На самом деле это не совсем так. Приватность важна, но не только она. У локальных моделей есть более важные качества, которые я опишу в этой статье.Первое преимущество локальных моделей

продолжить чтение

SciGraph: как я учил ИИ читать научные статьи не только по словам, но и по связям

Привет, Хабр. Эта статья про систему, которая читает папку научных статей и помогает разбираться в них как в связанном корпусе, а не как в наборе отдельных PDF. Материал написан на базе выпускного проекта студента курса NLP Advanced. Исходный код проекта: Идея простая: если в статье есть авторы, методы, датасеты, цитирования и утверждения, то их можно превратить в граф. Тогда вопрос «какие работы привели к появлению DETR?» становится не просто поиском похожих фраз, а проходом по связям между работами.

продолжить чтение