Как мы научили LLMCOD собирать базу знаний не только из HTML, но и из SPA и открытых API
Обычно задача «создать базу знаний из сайта» звучит просто: взять HTML, извлечь текст, разбить его на фрагменты, построить embeddings и отправить всё в RAG.На современных сайтах этот подход всё чаще перестаёт работать.Главная причина — сайт может практически не содержать данных в исходном HTML. Пользователь открывает страницу, браузер загружает JavaScript, JavaScript обращается к API, а уже API возвращает услуги, товары, объекты, статьи, цены и другие данные.Именно с такой проблемой мы столкнулись при разработке новой возможности в LLMCOD.
Сжатие данных — это предсказание
Недавно я читала материалы о сжатии данных, и меня внезапно озарила безумная мысль: по сути своей, алгоритмы сжатия и LLM предназначены для решения одной и той же задачи.
Сжатие словаря. Языки из омонимов и хроматическое число
В естественном языке распространено такое явление, что, чтобы установить значение слова, необходимо обратиться к контексту. На грядках растёт много лука. / Сильно натянута тетива лука.
Аудио-токенизатор KVAE-Audio от Сбера
Привет, Хабр. Мы уже показывали токенизаторы для изображений и видео, рассказывали про обновление видеомоделей KVAE-2.0, а теперь закрываем третью модальность — публикуем KVAE-Audio
Архиватор рождённый из теории предельного сжатия вселенной
Как всё начиналосьВ 1996 году, во время учёбы в военном институте по специальности «программирование», на занятиях по кодированию данных мне пришла идея. Что если построить бинарное преобразование по правилу:ВходВыход00001110011110
Как я экономлю 80% контекста нейросетей при работе с логами
ПроблемаЯ разрабатываю приложение KeyRay - кроссплатформенный аналог Punto Switcher, имеющий на порядок лучшую стабильность переключения раскладки. При разработке активно использую нейросети для отладки багов. И столкнулся с неприятной проблемой: при копировании логов в чат огромная часть контекстного окна уходит впустую. Работа с логами во время разработки в паре с ИИ занимает львиную долю времени и контекста чата.
Обновлённый токенизатор видео K-VAE 2.0 от Сбера
Несколько месяцев назад мы выпустили токенизаторы для видео и изображений — KVAE-1.0. Сегодня представляем следующее поколение: KVAE-2.0 — две новых модели, которые превосходят Wan 2.2 и HunyuanVideo 1.5 по объективным метрикам и качеству генерации и являются, таким образом, лучшими открытыми видео-токенизаторами. Код и веса выложены в открытый доступ.
Исследователи Кембриджа доказали, что вашей статьи не существует
СРОЧНО. Исследователи из Отдела предиктивных реконструкций (Department of Predictive Reconstructions) Королевского колледжа Кембриджа (King’s College Cambridge) доказали, что любой письменный текст можно свести к минимальному генеративному промпту и восстановить с семантической достоверностью 98%. Редакция получила доступ к препубликационному черновику. Рынки реагируют. Подробности ниже.Как это работает
Галлюцинации LLM — это артефакты сжатия. И это объясняет вообще всё
Представьте, что вам дают 10 терабайт текста и говорят запихнуть это в файл на 70 гигабайт. Да так, чтобы потом по любому вопросу можно было восстановить нужный кусок. Не точно, но близко, и не побайтово, но чтобы по смыслу билось.Вы бы сказали: «так это же lossy-компрессия, часть данных неизбежно потеряется».И были бы правы, потому что именно это делает LLM.Предсказание = сжатие (и это не метафора)Тут нужно кое-что объяснить, и это самое важное в статье.Клод Шеннон доказал в 1948 году: предсказание следующего символа и сжатие данных — математически одно и то же

