python. - страница 24

Как мы заставили vLLM «лениться» под нагрузкой и спасли Time-to-First-Token

Введение: Почему обычный Rate Limiting не работает для LLM?Деплой больших языковых моделей (LLM) — это всегда боль, когда дело доходит до пиковых нагрузок. В классических web-сервисах при высоких RPS мы просто включаем балансировщик, а если всё горит — жестко режем запросы HTTP 429 Too Many Requests.Но в мире генеративного AI отбрасывать запросы клиентов очень дорого: пользователь уже подождал, пока загрузится чат, написал длинный промпт, нажал Enter и… получил ошибку. А масштабирование GPU-кластера занимает минуты, которых у нас нет.В этой статье мы покажем, как подход “Динамической лени”

продолжить чтение

Несколько Клодов над одним проектом: locks, handoffs и email 1982 года

Я работаю с Claude Code параллельно на трёх подписках Pro. Плюс коллеги на своих мульти-аккаунтах, часто в тех же файлах, часто в один и тот же день.Когда мне надоело каждый новый чат заново пересказывать Claude’у курс дел - я придумала handoff’ы: короткую сводку, которую сессия пишет в конце и которую следующая читает при старте.Когда на долгих проектах handoff’ов накопилось по восемьдесят штук и новая сессия тратила полчаса на «как мы сюда вообще пришли» - я придумала rollup’ы: один handoff, который сворачивает двадцать предыдущих. Цепочка rollup’ов на длинной дистанции становится летописью проекта.

продолжить чтение

Как дообучать локальные LLM в 2026 году: практическое руководство

В 2026 году возможность дообучения локальных LLM стала реальной опцией для отдельных разработчиков и небольших команд. Это стало возможным благодаря снижению требований к видеопамяти (VRAM), развитию инструментов и расширению набора базовых моделей с открытыми лицензиями.

продолжить чтение

Мультиагентный хаос: как мы собрали команду AI-сотрудников, а получили бесконечное совещание ни о чем

Введение. Ложное обещание мультиагентностиВ 2026 году каждый второй стартап обещает заменить команду разработчиков роем AI-агентов. Звучит как мечта уставшего тимлида: один агент пишет код, второй ревьюит, третий деплоит, четвертый отвечает на вопросы в Slack, а пятый, наверное, уже сам заказывает пиццу в офис. Никаких больничных, никаких «я не успеваю», только железная продуктивность 24/7.

продолжить чтение

Как развернуть Qwen в облаке так, чтобы модель не была доступна из интернета

продолжить чтение

Практическое руководство по Qwen: установка, настройка vLLM и работа через API

продолжить чтение

Волков бояться — uplift в прод не катить, или AUF 2.0

Всем привет! Меня зовут Мельников Виктор, я middle data scientist в Альфа-Банке в Управлении по разработке инструментов автоматизации моделирования.Год назад вышла статья о первой open source библиотеке Альфа-Банка для автоматического построения uplift-моделей Automatic Uplift Framework или же, сокращённо, AUF🐺. В ней мы рассмотрели основной функционал библиотеки с примерами кода. Также в ней можно найти ссылку на ноутбук с примером кода на открытом датасете.

продолжить чтение

Как выучить Python и не разориться: 5 лучших бесплатных курсов для новичков

Привет, Хабр!Если вы сегодня решите вбить в поисковик «как выучить Python», вас моментально накроет лавиной таргетированной рекламы. Из каждого баннера будут кричать лозунги про «гарантированное трудоустройство», «успешный ИТ-успех» и выход на зарплату в 300к в наносекунду уже через пару месяцев обучения. Из-за такого агрессивного инфоцыганства у человека, который только присматривается к разработке, складывается стойкая иллюзия: чтобы выучить базу и написать первый рабочий код, нужно обязательно оформить рассрочку на пару сотен тысяч рублей.

продолжить чтение

LLM как декодер в ASR: опыт адаптации SOTA архитектуры для спонтанной русскоязычной речи

Привет, Хабр! Меня зовут Коля, я разработчик машинного обучения в команде речевых технологий Контура. Мы разрабатываем собственную систему распознавания речи (ASR), которая ежедневно переваривает миллионы звонков и записей видеоконференций, чтобы потом использовать их для речевой аналитики качества коммуникаций с клиентами и для создания протоколов и резюме встреч в Контур.Толке.Мы постоянно работаем над тем, чтобы дать пользователям лучшее качество и опыт взаимодействия с нашими продуктами: борьба уже давно идет за десятые доли процента WER (Word Error Rate) – особенно сложные и трудные для распознавания случаи.

продолжить чтение

Slow Feature Analysis. Разбор метода и реализация на Python с нуля

Привет, Хабр!В этой статье я хочу рассказать про метод обучения без учителя - “Анализ медленных признаков” (Slow Feature Analysis), далее SFA. Метод был разработан в 2002 году Лоренцом Вискоттом и Терренсом Сейновски.SFA можно использовать для выделения стабильных сигналов на фоне шума, такие как отслеживание объектов на видео, трендов цен из финансовых данных, признаков износа по вибрациям оборудования.SFA

продолжить чтение

1...10...222324252627...4050...94