llm.
Как мы проверяем до 1 000 cайтов в час: рассказываем про ЮScan — сервис оценки рисков в сегменте e-commerce
1000 сайтов в час вместо нескольких часов на каждый — так работает ЮScan, сервис автоматизированного аудита от ЮMoney. Его основная задача — помочь банкам и платёжным организациям не допустить подключения сайтов, которые маскируют запрещённую или рискованную деятельность под легальный бизнес. Сервис автоматически проверяет ресурс и выявляет подобные случаи ещё до начала сотрудничества.С 2020 года через ЮScan проверено более 550 тысяч заявок. За это время ЮKassa не получила штрафов за обслуживание запрещённых видов деятельности.Кому это нужно?
7 ошибок в оценке качества LLM‑систем в продакшене
Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как команды теряют контроль над качеством своих LLM‑фич и что с этим делают инженеры, у которых это работает.Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.
Скидка в 97%: как устроен китайский мошеннический рынок ИИ-токенов
Моя историяЯ долгое время размышлял о мошенничестве с токенами — проблеме, с которой впервые столкнулся, когда работал разработчиком ПО в ИИ-шлюзе.
Qwen3.8-27B: лучший локальный LLM, который вы, вероятно, не сможете запустить
В этом месяце Alibaba выпустила две модели, и та, о которой все писали, оказалась не той, что мы ждали. Qwen3.8-Max — это API с 2,4 триллионами параметров, и пару недель назад я с большим энтузиазмом написал о ней обзор. Но релиз, которого я действительно ждал, вышел 14 августа: Qwen3.8-27B, Apache 2.0, веса на Hugging Face, модель достаточно компактна, чтобы работать на ноутбуке.
Как мы автоматизировали обработку входящих клиентских обращений
Привет, Хабр! Меня зовут Дмитрий Тимохин, я лидер команды ML CRM «Кластер CRM и клиентский опыт» в ВТБ. В этой статье расскажу, как мы разрабатывали сервис анализа и категоризации клиентских обращений для центра клиентской поддержки корпоративно-инвестиционного бизнеса (ЦКП КИБ). В реальных бизнес-процессах автоматизировать клиентскую поддержку довольно непросто. Клиентские обращения редко представляют собой один цельный текст с понятным запросом: это звонки, чаты и письма одновременно, оборванные фразы, переключение между несколькими темами внутри одного диалога и неполные данные из разных источников.
Три месяца с Claude: хороший ассистент, плохой программист
Мне выдали подписку на Claude и сказали выжимать максимум из токенов, так что я решил дать ему честный шанс. В этой статье расскажу, что из этого вышло.В наши дни от LLM становится всё сложнее спрятаться. Даже если вы избегаете соцсетей — или хотя бы тщательно подбираете подписки, чтобы не видеть основную массу нейрослопа, — и пропускаете мимо ушей громкие маркетинговые заявления, которые потом в новостях почему‑то преподносят как факты, LLM, скорее всего, всё равно найдут вас на работе.
Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6
*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.## 1,9 из 6Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.
Ни строчки руками: как я вайбкодил AI-мастера D&D и что показали два месяца открытой беты
Каждый раз, когда на Хабре очередной срач про вайбкодинг, я сижу тихонько и молчу. Мне спорить неудобно: у меня в проде живёт продукт, где весь код — от миграций базы до анимации кубиков — написали агенты. Вообще весь. Клавиатура за полгода не набрала ни одного if.Продукт — «Таверна Мокрый Тортл», AI-мастер подземелий. Соло-игра в D&D 5e прямо в Telegram: бот плюс мини-апп с листом персонажа. Броски без поддавков, бой по правилам, магия, левелап. Сделал для тех, кто хочет играть в НРИ, но группу собрать не может — а таких, как выяснилось, немало) Бота зовут @dnd5char_bot
Теплый ламповый локальный инет. От Opencode и DocFetcher. «Свой лунопарк»
Уже лет 10 я пользуюсь Everything от VoidTools, и наслаждаюсь. Вся навигация в машине - поиск - только через него. Единственное что он не умеет делать быстро - искать в файлах по содержимому.Не в первый раз недавно посмотрел на DocFetcher, и стал он вдруг “LocalInet feat DocFetcher”.
Компилятор как первый ревьюер: петля верификации Go‑кода, который написал агент
Год назад мой типичный пулл‑реквест писался руками часа три и ревьюился минут двадцать. Сейчас четыреста строк агент выдаёт за минуту, а ревью того же дифа занимает час: приходится вычитывать уверенно написанный чужой код, в котором ошибка выглядит ровно так же убедительно, как правильное решение. Узкое место переехало с набора кода на его проверку, и усилием воли оно не расширяется.В августе у Google вышел текст о том, почему Go хорошо подходит для разработки с агентами

