machinelearning.

Memorization vs Generalization: что действительно умеет языковая модель (TLM) на 2 160 параметров (v1.1.0)

Продолжая тему Крошечной Языковой Модели на Nodejs мы поймем где проходит граница ее возможностей. На примере Крошечной Языковой Модели (TLM) из 2 160 параметров мы проведём воспроизводимый эксперимент и увидим в цифрах: знакомый шаблон - 99,93%, перестановка токенов - 81,69%, неизвестная структура -?%.По следам обсуждения моего автограда на Node.js в ML-сообществе и отличного фидбека от инженеров на Hashnode (привет Ahmet Özel), я добавил в проект небольшое исследование границы между запоминанием и обобщением в версии 1.1.0.Я зафиксировал seed 42 и добавил финальную frozen evaluation из четырёх проверок:

продолжить чтение

Языковая Модель без магии: Крошечная Language Model на чистом Node.js

Схема Языковой МоделиEnglish | РусскийTokenization → embeddings → causal Transformer → LM head → softmax → loss → backpropagation. Без TensorFlow, без PyTorch, и без hidden autograd.

продолжить чтение

Векторный поиск в модерации контента. Как поместить 200+ моделей в один ансамбль?

Привет, я Лев Нечаев. Когда-то я работал на заполярной атомной станции, а теперь руковожу командой «Автоматическая модерация методами ИИ» в RWB. В этой статье расскажу, как мы (успешно) применяем детекторы на основе векторного поиска в модерации контента на маркетплейсе.Начнём с предпосылок, первых моделей и сбора данных. Вместе пройдём путь от обучения до оценки качества детекторов в работе на реальных потоках данных.Будни команды автоматической модерации

продолжить чтение

Можно ли лучше? Activation Steering, pt 2: repeng, pyreft и другие способы найти вектор правильнее

У статьи есть 1 часть: Стягивай куда нужно: Activation Steering Tutorial Привет, друзья! В первой части мы разобрали базовую идею steering-а и реализовали её тремя способами: через сырые PyTorch hooks, через nnsight и через pyvene. Сработала ли наша база? Да — мы это видели. Нормально ли? Нет — и это мы тоже видели: вектор оказался инвертирован, эффект был умеренным, а на некоторых промптах не было никакого. Что с этим делать и как это сделать на питоне — и есть тема второй части.

продолжить чтение

Как я запустил перцептрон на обычном непрограммируемом калькуляторе Casio

Всем привет, это моя первая статья на Хабре и я решил посвятить ее своему недавнему мини‑проекту, сутью которого является обучение небольшого перцептрона 2-5-1 с помощью Python без сторонних библиотек (типа NumPy), и его последующий инференс на непрограммируемом инженерном калькуляторе Casio‑Fx-82-Es Plus (2nd edition). В качестве задачи для перцептрона я выбрал определение того, находится ли точка в пределах графика следующей лемнискаты Бернулли: (x² + y²)² — 2a²(x² — y²) = 0 (с a = sqrt(0.5), то есть вообще без коэффициента 2a²), с минимально приемлемой вероятностью (70–85%)

продолжить чтение

Ты сможешь! Введение в машинное обучение с подкреплением для программистов и не только

Для меня как программиста одна из самых больших сложностей в изучении технологий машинного обучения (ML) и искусственного интеллекта (AI) — разбор практических примеров.

продолжить чтение

Красота математики и ML (part 1-2): алгоритм MinHash

Вернулся к одному из своих исследований в области векторизации текста. Возможно, расскажу о нём позже, а пока, в поисках ответа на вопрос насколько моё исследование повторяет уже существующие разработки, изучил два интересных алгоритма.SimHash: про то, как векторизовать текст в плотный вектор из нулей и единиц.MinHash: про то, как транслировать разряжённый (sparse) бинарный вектор в компактный отпечаток, состоящий из целых чисел.Кроме того, что оба алгоритма работают с бинарными векторами, у них есть еще одна общая черта. Они оба гениальны в своей простоте и потому потрясающе красивы!

продолжить чтение

Я залез в исходники Claude Code. Фичи, которых нет в документации

Комментарий от эксперта Александра Шустанова

продолжить чтение

Как работает адаптивный RAG, которому вообще не нужна LLM

продолжить чтение

Выделение одного значащего признака из набора данных с помощью машинного обучения. Используется Apache Spark

Описание задачиВ первой части была создана инфраструктура для запуска машинного обучения. Там же была создана БД с данными для использования в примерах.В данной части будет искаться, какой тип файлов вызывает увеличение нагрузки. При этом, зная, какой именно тип файла был указан как вызывающий нагрузку.Будет использоваться машинное обучение в Apache Spark.Выборка исходных данных из БДНачать работу необходимо с выборки исходных данных для анализа. Структура БД описана в

продолжить чтение

123456...8