ASR для языка, которого Whisper почти не знает: LoRA за полтора часа — и почему полдела сделал декодер
В первой статье серии я рассказывал про речевые технологии для крымскотатарского в целом и обещал отдельно разобрать распознавание. Разбираю.Итоговая таблица, чтобы сразу было видно, о каких величинах речь. Один и тот же отложенный тест, один и тот же скоринг, 893 клипа / 1.86 ч, два диктора, которых модель не слышала:WERCERCER foldedбазовая модель (whisper-large-v3, ранее дотюненная под crh)0.34630.11880.1070+ LoRA (1 ч 30 м на ноутбучной видеокарте)
Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM
Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLMTL;DR
Где ещё дают LLM API бесплатно: проверяю очередные находки
Проверил малоизвестные LLM API с бесплатными моделями, лимитами и реальными запросами. Вот что получилось:AtriaСайт: https://api.atria-asi.ai/Документация: https://api.atria-asi.ai/docsAPI: https://api.atria-asi.ai/v1Сразу после регистрации мне начислили 100 000 000 токенов.
Как мы обучили детектор джейлбрейков для русскоязычных AI-агентов
Привет, Хабр! На связи команда R&D в Just AI, мы занимаемся исследованиями в области NLP и GenAI, чтобы продукты компании держали статус SOTA на рынке. В частности мы отвечаем за guard-модели и бенчмарки для продукта Jay Guard, о которых и пойдет речь в этой статье.
Давай по новой, Миша: speculative decoding от черновика до проверки
Маленькая модель быстро генерирует несколько следующих токенов, а большая проверяет их сразу одной пачкой. Подходящие токены принимаются, а с первого расхождения большая модель продолжает генерацию сама. При корректной реализации итоговое распределение остаётся тем же, что и при обычном декодировании. В speculative decoding большая модель буквально говорит черновой: «Давай по новой, Миша».На первый взгляд кажется, что ускорение здесь обязательно покупается ценой качества. Но нет: это как раз тот случай, когда можно ускорить генерацию без такого компромисса.
Как я строю нейросимвольное извлечение условий из тендерных документов
Почему лучший кандидат не всегда правильный Рабочее название прототипа: Tender Semantic Engine (TSE)Если фрагмент оказался неправильным ответом на один вопрос, сначала стоит проверить, не является ли он правильным ответом на другой.Задача, которая только кажется простойЯ разрабатываю настольную систему для работы с тендерами. Один из ее модулей должен читать комплект закупочной документации и переносить в карточку тендера конкретные условия: порядок оплаты, аванс, срок и место поставки, гарантию, обеспечение, штрафы и другие обязательства сторон.
Проверяем Jev на открытых и внутренних данных: классификаторили фильтр?
Jev отвечает только «да/нет» или выбирает один из предложенных вариантов. 16 000 вызовов:сначала сравнение с gpt-5.4-mini и gpt-5.6-luna на четырёх открытых датасетах, затем несколько тысяч реальных решений в рабочих процессах. Где он выигрывает, где ошибается и как его использовать.

