SINN: как превзойти спектральные методы при решении многомерных уравнений в частных производных
Привет, Хабр. Меня зовут Тянчи Ю, я работаю младшим научным сотрудником в группе «Вычислительный интеллект» AIRI и учусь на четвёртом году аспирантуры Сколтеха. Мои научные интересы включают научное машинное обучение и численный анализ, а также применение этих инструментов к задачам вычислительной математики.
Исследование: Claude Code отправляет в 4,7 раза больше служебных токенов, чем OpenCode
Компания Systima сравнила объём служебных данных, которые Claude Code и OpenCode передают языковой модели вместе с пользовательским запросом. Решение от Anthropic использует в 4,7 раза больше токенов и быстрее расходует лимит.
Ответ на Kimi K3: зачем Alibaba выкатила 2,4-триллионную Qwen3.8
На конференции WAIC в Шанхае Alibaba представила Qwen3.8 — новую мультимодальную модель на 2,4 трлн параметров. По заявлению компании, архитектура уступает по производительности только Claude Fable 5, хотя независимых бенчмарков пока нет.
Т9 за сотню долларов, ассистент за миллиард: сколько на самом деле стоит обучить LLM с нуля
В октябре 2025-го Андрей Карпатый выложил nanochat — «лучший ChatGPT, который можно купить за $100»: полный пайплайн от токенизатора до веб-чата, четыре часа на арендованной ноде. Еще в декабре 2024-го DeepSeek опубликовал техотчет V3 с цифрой $5,576 млн за обучение. А в конце января 2025-го, на волне выхода R1, заголовки «китайцы сделали GPT-4 за шесть миллионов» несколько дней трясли и прессу, и биржу. А два дня назад прямо здесь, на Хабре, вышла habrGPT — модель 0.5B, обученная с нуля на статьях Хабра на одной RTX 5090, с претрейном за ~6 часов.
OpenAI зашифровала внутренние инструкции Codex
OpenAI обновила работу ИИ-агента Codex. Теперь внутренние инструкции, которые он передаёт субагентам, отображаются в истории сессии в зашифрованном виде.
НКО Current AI заявила о намерении создать всемирную сеть ИИ
Некоммерческая организация Current AI планирует создать открытую и общедоступную инфраструктуру искусственного интеллекта. Компания запустила чат-бота с открытым исходным кодом на саммите AI for Good в Женеве.
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM
Привет, Хабр! Меня зовут Владимир, и это третья часть цикла статей по написании и обучению небольшой decoder-only LLM с нуля. В первой части мы обучили токенизатор и собрали pretrain-датасет, во второй части реализовали класс Трансформер-блока. В этой части будем собирать и предобучать нашу LLM.Содержание циклаПодготовка и токенизация данныхТрансформерСборка и обучение LLM (вы находитесь здесь)SFT этап (дообучение на Вопрос-Ответ)

