Машинное обучение. - страница 20

Я вычислю тебя по бз-бз-бз: создали ИИ-устройство против малярии

продолжить чтение

SINN: как превзойти спектральные методы при решении многомерных уравнений в частных производных

Привет, Хабр. Меня зовут Тянчи Ю, я работаю младшим научным сотрудником в группе «Вычислительный интеллект» AIRI и учусь на четвёртом году аспирантуры Сколтеха. Мои научные интересы включают научное машинное обучение и численный анализ, а также применение этих инструментов к задачам вычислительной математики.

продолжить чтение

Исследование: Claude Code отправляет в 4,7 раза больше служебных токенов, чем OpenCode

Компания Systima сравнила объём служебных данных, которые Claude Code и OpenCode передают языковой модели вместе с пользовательским запросом. Решение от Anthropic использует в 4,7 раза больше токенов и быстрее расходует лимит. 

продолжить чтение

Ответ на Kimi K3: зачем Alibaba выкатила 2,4-триллионную Qwen3.8

На конференции WAIC в Шанхае Alibaba представила Qwen3.8 — новую мультимодальную модель на 2,4 трлн параметров. По заявлению компании, архитектура уступает по производительности только Claude Fable 5, хотя независимых бенчмарков пока нет.

продолжить чтение

Как я три года пилю свой музыкальный сервер: часть первая

Приветствую, сообщество Habr!Меня зовут Дмитрий, я инженер-программист с почти 20-летним опытом, последние 12 лет живу в Лондоне. Я увлекаюсь Hi-Fi, не представляю свою жизнь без музыки и хочу рассказать о Kalinka — открытом музыкальном стримере, который появился на стыке трёх моих интересов: музыки, программирования и Linux.За несколько лет Kalinka выросла из небольшого эксперимента с Raspberry Pi в полноценную систему с собственным нативным аудиоплеером, сервером, клиентским приложением, поддержкой локальной музыкальной коллекции и стриминговых сервисов.

продолжить чтение

Данные, которые нельзя выдумать: как мы собираем трейсы для тренировки агентских навыков Cotype

продолжить чтение

Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля

В октябре 2025-го Андрей Карпатый выложил nanochat — «лучший ChatGPT, который можно купить за $100»: полный пайплайн от токенизатора до веб-чата, четыре часа на арендованной ноде. Еще в декабре 2024-го DeepSeek опубликовал техотчет V3 с цифрой $5,576 млн за обучение. А в конце января 2025-го, на волне выхода R1, заголовки «китайцы сделали GPT-4 за шесть миллионов» несколько дней трясли и прессу, и биржу. А два дня назад прямо здесь, на Хабре, вышла habrGPT — модель 0.5B, обученная с нуля на статьях Хабра на одной RTX 5090, с претрейном за ~6 часов.

продолжить чтение

OpenAI зашифровала внутренние инструкции Codex

OpenAI обновила работу ИИ-агента Codex. Теперь внутренние инструкции, которые он передаёт субагентам, отображаются в истории сессии в зашифрованном виде.

продолжить чтение

НКО Current AI заявила о намерении создать всемирную сеть ИИ

Некоммерческая организация Current AI планирует создать открытую и общедоступную инфраструктуру искусственного интеллекта. Компания запустила чат-бота с открытым исходным кодом на саммите AI for Good в Женеве.

продолжить чтение

Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM (вы находитесь здесь)SFT этап (дообучение на Вопрос-Ответ)

продолжить чтение

1...10...181920212223...3040...522