llm. - страница 44

llm.

Как мы проверяем до 1 000 cайтов в час: рассказываем про ЮScan — сервис оценки рисков в сегменте e-commerce

1000 сайтов в час вместо нескольких часов на каждый — так работает ЮScan, сервис автоматизированного аудита от ЮMoney. Его основная задача — помочь банкам и платёжным организациям не допустить подключения сайтов, которые маскируют запрещённую или рискованную деятельность под легальный бизнес. Сервис автоматически проверяет ресурс и выявляет подобные случаи ещё до начала сотрудничества.С 2020 года через ЮScan проверено более 550 тысяч заявок. За это время ЮKassa не получила штрафов за обслуживание запрещённых видов деятельности.Кому это нужно?

продолжить чтение

7 ошибок в оценке качества LLM‑систем в продакшене

Всем привет, меня зовут Сергей Прощаев и в этой статье расскажу про то, как команды теряют контроль над качеством своих LLM‑фич и что с этим делают инженеры, у которых это работает.Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.

продолжить чтение

Скидка в 97%: как устроен китайский мошеннический рынок ИИ-токенов

Моя историяЯ долгое время размышлял о мошенничестве с токенами — проблеме, с которой впервые столкнулся, когда работал разработчиком ПО в ИИ-шлюзе.

продолжить чтение

Qwen3.8-27B: лучший локальный LLM, который вы, вероятно, не сможете запустить

В этом месяце Alibaba выпустила две модели, и та, о которой все писали, оказалась не той, что мы ждали. Qwen3.8-Max — это API с 2,4 триллионами параметров, и пару недель назад я с большим энтузиазмом написал о ней обзор. Но релиз, которого я действительно ждал, вышел 14 августа: Qwen3.8-27B, Apache 2.0, веса на Hugging Face, модель достаточно компактна, чтобы работать на ноутбуке.

продолжить чтение

Как мы автоматизировали обработку входящих клиентских обращений

Привет, Хабр! Меня зовут Дмитрий Тимохин, я лидер команды ML CRM «Кластер CRM и клиентский опыт» в ВТБ. В этой статье расскажу, как мы разрабатывали сервис анализа и категоризации клиентских обращений для центра клиентской поддержки корпоративно-инвестиционного бизнеса (ЦКП КИБ). В реальных бизнес-процессах автоматизировать клиентскую поддержку довольно непросто. Клиентские обращения редко представляют собой один цельный текст с понятным запросом: это звонки, чаты и письма одновременно, оборванные фразы, переключение между несколькими темами внутри одного диалога и неполные данные из разных источников.

продолжить чтение

Три месяца с Claude: хороший ассистент, плохой программист

Мне выдали подписку на Claude и сказали выжимать максимум из токенов, так что я решил дать ему честный шанс. В этой статье расскажу, что из этого вышло.В наши дни от LLM становится всё сложнее спрятаться. Даже если вы избегаете соцсетей — или хотя бы тщательно подбираете подписки, чтобы не видеть основную массу нейрослопа, — и пропускаете мимо ушей громкие маркетинговые заявления, которые потом в новостях почему‑то преподносят как факты, LLM, скорее всего, всё равно найдут вас на работе.

продолжить чтение

Шесть LLM‑судей из четырёх лабораторий несут 1,9 независимого голоса из 6

*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых голосов стоит за этим консенсусом. Оказалось — примерно два.## 1,9 из 6Посадите шесть разных инструктивных LLM судить одну задачу и выносить вердикт голосованием — интуиция подсказывает, что шесть моделей из четырёх лабораторий надёжнее одной: разные компании, архитектуры, страны, ошибки же должны быть независимыми.

продолжить чтение

Ни строчки руками: как я вайбкодил AI-мастера D&D и что показали два месяца открытой беты

Каждый раз, когда на Хабре очередной срач про вайбкодинг, я сижу тихонько и молчу. Мне спорить неудобно: у меня в проде живёт продукт, где весь код — от миграций базы до анимации кубиков — написали агенты. Вообще весь. Клавиатура за полгода не набрала ни одного if.Продукт — «Таверна Мокрый Тортл», AI-мастер подземелий. Соло-игра в D&D 5e прямо в Telegram: бот плюс мини-апп с листом персонажа. Броски без поддавков, бой по правилам, магия, левелап. Сделал для тех, кто хочет играть в НРИ, но группу собрать не может — а таких, как выяснилось, немало) Бота зовут @dnd5char_bot

продолжить чтение

Теплый ламповый локальный инет. От Opencode и DocFetcher. «Свой лунопарк»

Уже лет 10 я пользуюсь Everything от VoidTools, и наслаждаюсь. Вся навигация в машине - поиск - только через него. Единственное что он не умеет делать быстро - искать в файлах по содержимому.Не в первый раз недавно посмотрел на DocFetcher, и стал он вдруг “LocalInet feat DocFetcher”.

продолжить чтение

Компилятор как первый ревьюер: петля верификации Go‑кода, который написал агент

Год назад мой типичный пулл‑реквест писался руками часа три и ревьюился минут двадцать. Сейчас четыреста строк агент выдаёт за минуту, а ревью того же дифа занимает час: приходится вычитывать уверенно написанный чужой код, в котором ошибка выглядит ровно так же убедительно, как правильное решение. Узкое место переехало с набора кода на его проверку, и усилием воли оно не расширяется.В августе у Google вышел текст о том, почему Go хорошо подходит для разработки с агентами

продолжить чтение