Поиск в глубину: какие инструменты помогают работать поиску в Uzum Market
Всем привет! Меня зовут Дмитрий Шипилов, с вами команда поиска Uzum Market.Мы уже рассказывали вам о нашем поисковом движке: о том, как вообще работает ранжирование и что у него под капотом и как мы получаем кандидатов с помощью векторного поиска.
Побеждаем OOM в PyTorch: как обучать гигантские графы на обычной видеокарте
Если вы обучаете графные нейросети или Knowledge Graph Embeddings на миллионы узлов, вы наверняка сталкивались с тем, что стандартный torch.optim.SparseAdam моментально забивает всю оперативную память или видеопамять.Я разработал маленький пакет Disk Sparse Adam (DSA) — Out-of-Core оптимизатор для PyTorch, который выносит состояния моментов (
16 и ещё 1 причина знать SHAP
Мы знаем его как "метод на основе теории игр", "фреймворк" и чувствуем, что это он, видя красные и синие полоски. Но что сделало этот метод таким популярным? Как он родился и почему, после релиза в 2017 году, разные группы исследователей добавляли в него новые расширения? Куда этот инструмент шел и к чему пришел сейчас? И наконец, почему надо его знать? Предлагаю впервые за долгое время потрогать от меня статью без кода — но с картинками. В ней вы узнаете ответы на вопросы и отроете для себя 15 расширений SHAP. Почему в названии 16 и ещё одна? Узнаете, если пройдете сквозь всю статью : )
Архитектура LLM-агентов для самых маленьких
Являясь LLM активистом, регулярно обсуждаю всякое про новостиинструментытренды в ИИ. И к моему удивлению зачастую люди из IT не понимают базовых вещей в работе LLM и сопутствующих инструментах. Эта статья — переложение доклада на внутреннем митапе. Основная ее цель - обозначить как из сервера с моделью получаются полноценные агентные системы.А начнем мы с того, что представим сервер с развернутой LLM, как рыбку Дори.
Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 параметров (v1.1.0)
Продолжая тему Крошечной Языковой Модели на Nodejs мы поймем где проходит граница ее возможностей. На примере Крошечной Языковой Модели (TLM) из 2 160 параметров мы проведём воспроизводимый эксперимент и увидим в цифрах: знакомый шаблон - 99,93%, перестановка токенов - 81,69%, неизвестная структура -?%.По следам обсуждения моего автограда на Node.js в ML-сообществе и отличного фидбека от инженеров на Hashnode (привет Ahmet Özel), я добавил в проект небольшое исследование границы между запоминанием и обобщением в версии 1.1.0.Я зафиксировал seed 42 и добавил финальную frozen evaluation из четырёх проверок:
Языковая Модель без магии: Крошечная Language Model на чистом Node.js
Схема Языковой МоделиEnglish | РусскийTokenization → embeddings → causal Transformer → LM head → softmax → loss → backpropagation. Без TensorFlow, без PyTorch, и без hidden autograd.
SINN: как превзойти спектральные методы при решении многомерных уравнений в частных производных
Привет, Хабр. Меня зовут Тянчи Ю, я работаю младшим научным сотрудником в группе «Вычислительный интеллект» AIRI и учусь на четвёртом году аспирантуры Сколтеха. Мои научные интересы включают научное машинное обучение и численный анализ, а также применение этих инструментов к задачам вычислительной математики.
Почему «чем проще, тем лучше» не работает на ИИ-классификаторе
Micro F1 = 0.9358. Число, с которым можно спокойно закрывать задачу в трекере — если не разбираться дальше. Но стоило посмотреть на precision и recall по каждому из 15 классов отдельно, как выяснилось: качество части классов тестовый набор фактически не проверяет — для одного из них в test split вообще не было положительных примеров.Это разбор конкретного случая: как агрегированная метрика может скрывать классификатор, бесполезный именно там, где он важнее всего. И почему принцип KISS, на который я обычно опираюсь, в multi-label задачах работает не так прямолинейно, как кажется.Контекст: зачем вообще классификатор

