LLM зацикливается: как найти причину, не трогая параметры?
Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про аварию, которую сложно поймать тестами.Сервис на базе LLM три недели работает нормально, а потом начинает отдавать отчёты, где с середины примерно двадцать раз подряд идёт один и тот же абзац, а дальше — обрыв на полуслове. Пользователи присылают скриншоты, GPU занят
Как запустить Qwen3.8-27B локально на RTX3090 (Win10)
На подготовку данной пошаговой инструкции меня вдохновил пост А все-таки Qwen3.8-27B — думает меньше и быстрее чем 3.6 от @rtrgdfb. При повторении действий по скачиванию и конвертации модели из этого поста я понял, что многие технические детали сокращены или не совсем очевидны при первом знакомстве, так как автор, на мой взгляд, ставил целью донести сообщение о том, что Qwen3.8-27B стала лучше, если правильно настроить параметры для средства запуска моделей llama_server (входит в llama.cpp
753B на одной видеокарте: разбор FreeToken
Чувак из Калифорнии вряд ли запускает это все на таком ноутбуке
Скидка в 97%: как устроен китайский мошеннический рынок ИИ-токенов
Моя историяЯ долгое время размышлял о мошенничестве с токенами — проблеме, с которой впервые столкнулся, когда работал разработчиком ПО в ИИ-шлюзе.
Как запустить LLM на 2,8 трлн параметров на ноутбуке
Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про то, как летом 2026 года большие языковые модели научились запускаться на железе, которое стоит под столом, а не в дата‑центре, и что из этого может забрать себе обычный backend‑инженер.Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.
ИИ‑прогноз погоды на своём железе: запускаем AIFS 2.0 от ECMWF
Открывать исходный код моделей — это здорово. Но если их запуск требует слишком много усилий, доступнее для сообщества они от этого почти не становятся. В этой статье мы разберём, как устранить этот разрыв: не просто открыть модели, но и упростить их запуск. Именно такую цель поставил перед собой ECMWF, когда открыл исходный код новых ИИ‑моделей AIFS. Эта статья — результат нашей совместной работы.
OpenAI и Cerebras разогнали GPT-5.6 Sol до 750 токенов в секунду
OpenAI и Cerebras представили Ultrafast, новый режим обработки запросов GPT-5.6 Sol в OpenAI API. Он генерирует до 750 выходных токенов в секунду и работает до 14 раз быстрее Standard processing.Это не отдельная облегчённая модель. Cerebras запускает полную GPT-5.6 Sol на своей инфраструктуре, поэтому, по заявлениям компаний, ускорение не требует снижать качество ответов. Пока Ultrafast доступен только ограниченной группе клиентов, а стоимость режима не раскрыта.
NVIDIA RTX PRO 5000 Blackwell с 72 Гб видеопамяти. Есть ли смысл переплачивать за «половинку» флагмана?
Nvidia окончательно запутывает нас своей линейкой Blackwell. Если посмотреть на PCI.ids выпущенных видеокарт профессионального семейства Blackwell, то мы увидим следующее:

