искусственный интеллект. - страница 288

DeepSeek выпустил V4 — открытую модель с контекстом в миллион токенов

Сегодня DeepSeek опубликовали две новые модели: V4-Pro и V4-Flash. Обе работают по архитектуре Mixture-of-Experts, веса доступны на Hugging Face под MIT-лицензией.

продолжить чтение

OpenAI Privacy Filter: красивая архитектура в суровых условиях русского бенчмарка

22 апреля 2026 года OpenAI выпустила OpenAI Privacy Filter

продолжить чтение

Разбор архитектуры и тест-драйв OpenAI Privacy Filter на бенчмарке персональных данных на русском

22 апреля 2026 года OpenAI выпустила OpenAI Privacy Filter

продолжить чтение

DeepSeek представляет флагманскую модель искусственного интеллекта

DeepSeek представила предварительные версии новой флагманской модели искусственного интеллекта версии V4 Flash и V4 Pro, которые демонстрируют высочайшую производительность в тестах на кодирование и значительный прогресс в решении логических и агентных задач. Они оснащены несколькими обновленными архитектурами и оптимизированными функциями и могут работать с контекстом длиной в миллион токенов. DeepSeek отдельно выделил технологию, которую назвал гибридной архитектурой внимания. По словам разработчиков, она улучшает способность ИИ запоминать запросы в ходе длительных диалогов.

продолжить чтение

Как мы заставили vLLM «лениться» под нагрузкой и спасли Time-to-First-Token

Введение: Почему обычный Rate Limiting не работает для LLM?Деплой больших языковых моделей (LLM) — это всегда боль, когда дело доходит до пиковых нагрузок. В классических web-сервисах при высоких RPS мы просто включаем балансировщик, а если всё горит — жестко режем запросы HTTP 429 Too Many Requests.Но в мире генеративного AI отбрасывать запросы клиентов очень дорого: пользователь уже подождал, пока загрузится чат, написал длинный промпт, нажал Enter и… получил ошибку. А масштабирование GPU-кластера занимает минуты, которых у нас нет.В этой статье мы покажем, как подход “Динамической лени”

продолжить чтение

Выжать больше из локальных LLM. Ollama медленнее llama.cpp в 3 раза. UD_Q4_K_XL лучше чем Q4_K_M, а вес тот же и т.д

продолжить чтение

Волшебный Koog. Пишем Kotlin-агент широкого профиля KMP

продолжить чтение

Gemma 4: что это такое и какую модель выбрать?

продолжить чтение

Tencent запустила тестирование ИИ-агента QClaw, но сильно ограничила к нему доступ

продолжить чтение

Вышла GPT-5.5 — модель, которая сама создала часть своего инференса

OpenAI выпустила GPT-5.5 — новый флагман, который, по заявлению компании, сам помог переписать часть своего инференс-стека. Модель проанализировала недели продакшн-трафика и написала алгоритм балансировки запросов между вычислительными ядрами GPU — после этого скорость генерации токенов в продакшне выросла больше чем на 20%. GPT-5.5 и GPT-5.5 Pro сегодня раскатываются в ChatGPT и Codex для Plus, Pro, Business и Enterprise пользователей; в API OpenAI обещает поставить модель в ближайшее время.Это продолжение тренда, который компания обозначила

продолжить чтение