cache.

Как и зачем ускоряют LLM

Зачем вообще нужен KV cache?Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache. С помощью него происходит оптимизация трансформера.Мы знаем, что сегодняшние большие языковые модели опираются на архитектуру transformer, а самое важное понятие в трансформере — механизм attention(он же механизм внимания). Кратко напомним: attention помогает уловить смысл слова, учитывая все окружающие слова. Это делается через attention-вычисления.

продолжить чтение

Подробная инструкция по настройке Squid 7.5 (Squid proxy, krb+ldap auth, ssl-bump, log in JSON, delay, cache)

Инструкция по настройке Squid HTTP-proxy в корпоративной среде.В данной инструкции решается задача по настройке прокси-сервера Squid для контроля интернет-доступа пользователей.Что включает в себя статья:Подготовка OpenSSL и Squid. Загрузка, сборка и установка пакета OpenSSL.Загрузка, сборка и установка пакета Squid.Настройка запуска через systemd.Настройка аутентификации пользователей на основе Kerberos и LDAP. Создание токена keytab - Windows AD DC.

продолжить чтение

Prompt Caching: токены LLM в 10 раз дешевле — но за счёт чего?

Команда AI for Devs подготовила перевод и разбор статьи о Prompt Caching — технологии, которая делает входные токены LLM в разы дешевле и заметно снижает задержки. Внутри — подробное объяснение, что именно кэшируют OpenAI и Anthropic, как KV-кэш связан с attention в трансформерах и почему это не имеет ничего общего с повторным использованием ответов.На момент, когда я пишу эту статью, закэшированные входные токены стоят в долларах за токен примерно в 10 раз дешевле обычных входных токенов — как в API OpenAI, так и Anthropic.

продолжить чтение

Векторный кэш: делаем умные ответы еще быстрее

Введение

продолжить чтение