кеширование.

Как и зачем ускоряют LLM

Зачем вообще нужен KV cache?Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache. С помощью него происходит оптимизация трансформера.Мы знаем, что сегодняшние большие языковые модели опираются на архитектуру transformer, а самое важное понятие в трансформере — механизм attention(он же механизм внимания). Кратко напомним: attention помогает уловить смысл слова, учитывая все окружающие слова. Это делается через attention-вычисления.

продолжить чтение

Умная афиша концертов Золотого кольца России: Python + LLM

Содержание: 1. Знакомство с сервисом 2. Архитектура 3. Важные нюансы 4. Развёртывание в PROD1. Знакомство с сервисомКак это работает? Представим, что «Знаток концертов» — Ваш умный библиотекарь 📚. Он настоящий специалист в своём деле, и по каждой книге (концерту) у него есть заметка с кратким содержанием 📝Вы приходите к библиотекарю с мыслью "что-то этакое почитать"

продолжить чтение

Строим корпоративную GenAI-платформу: от концепции до ROI. Часть 3. Retrieval-Augmented Generation (RAG) на службе GenAI

В предыдущих статьях серии (Часть 1, Часть 2) мы обсудили концепцию корпоративной GenAI-платформы и подходы к ее разработке. Теперь перейдем к одному из ключевых компонентов такой платформы — интеграции знаний с помощью Retrieval-Augmented Generation (RAG). Что такое RAG и зачем он нуженRetrieval-Augmented Generation (RAG)

продолжить чтение