llm.
GPT-5.5 против DeepSeek-V4: почему OpenAI удваивает цены, пока Китай демпингует
GPT-2 мой новый фаворит для обложекЗа последние 48 часов индустрия ИИ пережила сразу 2 тектонических сдвига. Практически одновременно, 23 и 24 апреля 2026 года, свет увидели две новые флагманские модели: GPT-5.5 от OpenAI
AI в iOS-разработке: что у меня реально закрепилось в 2026, а что я выкинул
За последние полгода я перетряс свой рабочий стек полностью: Cursor, Claude Code, Codex, локальные Qwen-модели для ревью, несколько итераций своего AGENTS.md, Xcode MCP, mobile-mcp, Conductor для параллельных сессий. Что-то прижилось, что-то я удалил через неделю, а какие-то практики, которые ещё весной казались обязательными, сейчас выглядят странно.Ниже — мои личные заметки по итогам этих полугода, а не обзор индустрии. Многое я подсмотрел у коллег и в чатах, не всё придумал сам.1. Минимализм в AGENTS.mdЕсли у вас CLAUDE.md (или AGENTS.md
DeepSeek выпустил V4 — открытую модель с контекстом в миллион токенов
Сегодня DeepSeek опубликовали две новые модели: V4-Pro и V4-Flash. Обе работают по архитектуре Mixture-of-Experts, веса доступны на Hugging Face под MIT-лицензией.
OpenAI Privacy Filter: красивая архитектура в суровых условиях русского бенчмарка
22 апреля 2026 года OpenAI выпустила OpenAI Privacy Filter
Разбор архитектуры и тест-драйв OpenAI Privacy Filter на бенчмарке персональных данных на русском
22 апреля 2026 года OpenAI выпустила OpenAI Privacy Filter
Как мы заставили vLLM «лениться» под нагрузкой и спасли Time-to-First-Token
Введение: Почему обычный Rate Limiting не работает для LLM?Деплой больших языковых моделей (LLM) — это всегда боль, когда дело доходит до пиковых нагрузок. В классических web-сервисах при высоких RPS мы просто включаем балансировщик, а если всё горит — жестко режем запросы HTTP 429 Too Many Requests.Но в мире генеративного AI отбрасывать запросы клиентов очень дорого: пользователь уже подождал, пока загрузится чат, написал длинный промпт, нажал Enter и… получил ошибку. А масштабирование GPU-кластера занимает минуты, которых у нас нет.В этой статье мы покажем, как подход “Динамической лени”
OpenAI выпустили GPT-5.5: пишет код дешевле предшественника
GPT-5.5 — это следующая модель после GPT-5.4, ориентированная прежде всего на агентную работу: многошаговые задачи, где модель планирует, использует инструменты и доводит работу до конца без постоянного участия пользователя.На Terminal-Bench 2.0 (сложные командно-строковые сценарии с планированием и итерациями) модель показала 82.7% против 75.1% у GPT-5.4. На SWE-Bench Pro, который оценивает решение реальных GitHub-задач, — 58.6%. Примечательно, что этих результатов GPT-5.5 достигает при меньшем количестве токенов, чем предшественник.

