DeepSeek выпустил V4 — открытую модель с контекстом в миллион токенов
Сегодня DeepSeek опубликовали две новые модели: V4-Pro и V4-Flash. Обе работают по архитектуре Mixture-of-Experts, веса доступны на Hugging Face под MIT-лицензией.
OpenAI Privacy Filter: красивая архитектура в суровых условиях русского бенчмарка
22 апреля 2026 года OpenAI выпустила OpenAI Privacy Filter
Разбор архитектуры и тест-драйв OpenAI Privacy Filter на бенчмарке персональных данных на русском
22 апреля 2026 года OpenAI выпустила OpenAI Privacy Filter
DeepSeek представляет флагманскую модель искусственного интеллекта
DeepSeek представила предварительные версии новой флагманской модели искусственного интеллекта версии V4 Flash и V4 Pro, которые демонстрируют высочайшую производительность в тестах на кодирование и значительный прогресс в решении логических и агентных задач. Они оснащены несколькими обновленными архитектурами и оптимизированными функциями и могут работать с контекстом длиной в миллион токенов. DeepSeek отдельно выделил технологию, которую назвал гибридной архитектурой внимания. По словам разработчиков, она улучшает способность ИИ запоминать запросы в ходе длительных диалогов.
Как мы заставили vLLM «лениться» под нагрузкой и спасли Time-to-First-Token
Введение: Почему обычный Rate Limiting не работает для LLM?Деплой больших языковых моделей (LLM) — это всегда боль, когда дело доходит до пиковых нагрузок. В классических web-сервисах при высоких RPS мы просто включаем балансировщик, а если всё горит — жестко режем запросы HTTP 429 Too Many Requests.Но в мире генеративного AI отбрасывать запросы клиентов очень дорого: пользователь уже подождал, пока загрузится чат, написал длинный промпт, нажал Enter и… получил ошибку. А масштабирование GPU-кластера занимает минуты, которых у нас нет.В этой статье мы покажем, как подход “Динамической лени”
Вышла GPT-5.5 — модель, которая сама создала часть своего инференса
OpenAI выпустила GPT-5.5 — новый флагман, который, по заявлению компании, сам помог переписать часть своего инференс-стека. Модель проанализировала недели продакшн-трафика и написала алгоритм балансировки запросов между вычислительными ядрами GPU — после этого скорость генерации токенов в продакшне выросла больше чем на 20%. GPT-5.5 и GPT-5.5 Pro сегодня раскатываются в ChatGPT и Codex для Plus, Pro, Business и Enterprise пользователей; в API OpenAI обещает поставить модель в ближайшее время.Это продолжение тренда, который компания обозначила

