CMF: новый формат для создания специализированных LLM моделей
Универсальные языковые модели умеют решать множество задач, но за эту универсальность приходится платить: они большие, тяжёлые и содержат множество переплетённых способностей сразу. Мне хотелось научиться брать уже обученную LLM и компилировать её под конкретную работу, получая компактного специалиста, который можно запускать на более дешевом оборудовании.При этом одна универсальная модель могла бы служить основой для целого семейства таких специалистов с автоматическим выбором подходящего под каждый запрос.
RUMBA: русскоязычный бенчмарк для оценки долгосрочной памяти
Память стала одной из самых востребованных функций диалоговых и агентных систем. Если пользователь регулярно обращается к ассистенту — для работы, консультаций, планирования, обучения или бытовых задач, — то от системы уже ожидают не просто хорошего общего ответа. От неё ждут, что она будет учитывать прошлые взаимодействия: помнить неизменные факты о пользователе, не терять важный контекст, обновлять устаревшую информацию и понимать, когда именно произошло то или иное событие.
Рецепт vLLM с мистралем. Часть 1
На первом этапе нашей заготовки модели мы займемся ее 4-х битным квантованием, а во второй части будем использовать vLLM для запуска парралельных запросов к ней.Поехали!
Анатомия памяти LLM: Почему будущее не за промптами, а за Инженерией Контекста
При работе с API больших языковых моделей я привык к определенной предсказуемости. Для моих исследовательских задач, экспериментов с кодом и повседневной рутины дневные расходы на API обычно колеблются в предсказуемом и комфортном диапазоне 3-4 евро. Это стало своего рода фоновым шумом, константой, на которую я перестал обращать внимание.Но в конце июля я увидел в биллинге Google API картину, которая заставила меня остановиться и задуматься. Вместо привычной цифры там красовалась аномалия — €51.

