Natural Language Processing. - страница 3

Спекулятивное декодирование: от чего на самом деле зависит ускорение

Языковая модель пишет ответ по одному токену за шаг, и на каждом шаге прочитывает все свои веса от начала до конца. Спекулятивное декодирование пытается это обойти: маленькая черновая модель набрасывает несколько токенов вперёд, причём сразу деревом вариантов, а большая проверяет всё это дерево за один свой проход и принимает ту ветку, которая совпала с её собственным выбором. Текст на выходе получается тот же самый, быстрее становится только его получение. Так устроен метод из статьи EAGLE-3 с NeurIPS 2025, и авторы приводят для него ускорение до 6.5 раза.

продолжить чтение

Искусственный интеллект: смерть учителя — или рождение нового?

Что останется от профессии учителя, когда машина научилась объяснять, проверять и создавать учебные материалы быстрееДмитрий Полетаев

продолжить чтение

Куда уходят токены у кодинг-агента: разбираем счёт по полям usage

В прошлый раз я разбирал, куда именно ходит Claude Code и какие бывают ключи. Логичное продолжение — куда уходят деньги. Потому что первый вопрос, который возникает после недели работы с агентом: почему счёт растёт быстрее, чем кажется по объёму кода.Ниже — разбор по полям usage, механика кэша и правила, которые у меня реально срезали расход. Без магии, всё проверяется в ответе API.Из чего состоит счётТокены, за которые вы платите, делятся не на два типа, а минимум на пять:ТипЧто этоПорядок ценыInput (miss)

продолжить чтение

Бесплатный API для LLM: тестирую 6 сервисов, модели и реальные лимиты

Для каждого сервиса смотрел, что именно дают после регистрации, какие модели действительно отвечают через API, сколько расходуется баланса и какие ограничения по RPM/RPD удаётся подтвердить. Где официальных лимитов нет, проводил собственные короткие нагрузочные тесты. Что удалось найти Token HarborСайт: https://tokenharbor.ai/Документация: https://tokenharbor.ai/docsAPI: https://tokenharbor.ai/v1У Token Harbor есть полноценный бесплатный тариф за $0

продолжить чтение

MEO: ещё одна маркетинговая аббревиатура или реальная техническая проблема ранжирования?

продолжить чтение

DLP для LLM: как обезличивать запросы и не ломать поиск по сотрудникам

Меня зовут Андрей Непряхин, я технический директор AGIMA. В AGIMA мы строим внутренний контур, через который сотрудники работают с LLM и агентами. Одна из самых неприятных задач в таком контуре — не просто спрятать имя или телефон перед отправкой запроса во внешнюю модель, а сохранить смысл запроса. Представьте: сотрудник пишет «найди последние задачи Петрова по проекту X и сравни их с обсуждением на встречах». Если заменить Петрова на NAME_1, а в соседнем сообщении — на случайный NAME_7

продолжить чтение

Степени свободы вместо пользы или почему три закона Азимова не работают

Сейчас я вижу в СМИ очень много сообщений о том, что тот или иной человек, близкий к разработкам ИИ, начинает паниковать от того что "мы все умрем" и ИИ нас уничтожит. И грешат этим даже профессионалы. Тем не менее, на мой взгляд, выход здесь есть и достаточно универсальный.

продолжить чтение

Я попробовал ужать LLaMA-7B до 1 ГБ без дообучения. Вот что произошло после 60+ экспериментов

В какой‑то момент я посмотрел на 13 ГБ весов LLaMA-7B и подумал: а почему, собственно, они должны занимать именно столько? Что, если не делать маленькую модель, не учить её заново и не заставлять копировать большую, а просто найти более короткую запись тех же «мозгов»?Здравый человек, вероятно, скачал бы готовую квантизацию и пошёл заниматься своими делами. Я вместо этого поставил цель ужать модель сначала до 2 ГБ, а в идеале — до одного. Без дообучения, дистилляции, pruning и изменения архитектуры. Только математика над уже готовыми весами и небольшая выборка текстов для калибровки.

продолжить чтение

Шесть мест, где за два месяца в проде ломался LLM-конвейер над лентами закупок, и почти все вне промптов

продолжить чтение

Как с помощью graph RAG добиться многоходовых рассуждений от LLM с 2B весов

Пару недель назад YouTube подкинул мне пятиминутный ролик с небольшого канала, где автор демонстрирует преимущества RAG на графах над обычным RAG поверх корпуса текстов.Пример довольно простой. LLM должна ответить на вопрос: “Кто должен подписать возврат клиенту на 800 фунтов в марте?”. Ответ, естественно, содержится в предоставленных текстах, но для того, чтобы его добыть, нужно уметь в multi-hop reasoning, т.к. необходимая информация лежит в 3х разных местах:инструкциях по возврату средствсписке сотрудниковсообщениях электронной почтыДля правильного ответа (

продолжить чтение