Мощный ИИ агент в 16гб VRAM
Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.нарисовано моделью из статьи
Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате
Экспериментальный O(1)-режим CMF заменяет растущий KV-кэш в 16 full-attention слоях Qwen3.8-27B фиксированным состоянием 44,1 МиБ. На длине 64K это сопоставляется с 4 ГиБ FP16 KV-кэша, но ценой приближённого восстановления дальнего контекста.Статья про CMF форматВ CMF
Роутинг NGINX на предикатах для обработки API‑трафика без скриптов
ВведениеВ сентябре 2026 года мы выпустили NGINX 1.31.5 с несколькими ключевыми фичами, объединёнными одной целью. Мы расширили базовые методы маршрутизации и самые важные директивы nginx, чтобы обеспечить прямую, не требующую скриптов маршрутизацию любого API‑трафика. В этом посте мы разберём самую важную возможность, которую мы назвали «предикатные локейшены» (predicate locations), и объясним, как она сочетается с остальными улучшениями, которые мы делаем для поддержки современных приложений.Проблема
MCP Gateway: когда инструменты перестают быть интеграцией и становятся архитектурой
Привет, Хабр! Меня зовут Илья Гуляев, я работаю в команде Рег.облака над облачными решениями
Куда делись мои токены?
Когда начинаешь плотно работать с AI-агентом, кажется, что бОльшая часть токенов улетает на сложные процессы - код написать, сайт разобрать, статью подготовить, браузером поуправлять, в логах покопаться. Вроде логично, задача сложная, модель думает, инструменты дергает, контекст растет.
Нейро сети для самых маленьких. Часть первая (которая после нулевой). Удобство в прокрустовом ложе оптимизации
Это первая (после нулевой) статья из серии Нейро сети для самых маленьких, в которой мы разбираем инфраструктуру для запуска нейронных сетей.Для обучения и инференса нейросетей и для любых видов High Performance Computing используются специализированные технологии: GPU/TPU, RDMA, Kernel bypass, NVLink, InfiniBand, RoCE и другие. Про некоторые из них большинство только что-то слышали, но сталкиваться с ними не приходилось.Нельзя просто взять ванильный стек Linux, воткнуть в него 400 Gb Ethernet+IP и получить рабочее решение. Почему?
PostgreSQL для бэкендера: 10 фич, которыми мало пользуются, а зря
Привет! Меня зовут Тимур Исламгулов. Я преподаю в МФТИ и веду вебинары по PostgreSQL на курсе «Аналитик данных» в Нетологии. За эти годы я насмотрелся, как разработчики поднимают лишнюю инфраструктуру там, где хватило бы самой базы, — об этом и поговорим.

