DPO.

DPO.

Создание моделей, способных к рассуждению, с помощью дообучения GRPO

продолжить чтение

Дообучил pretrain ruGPT3 XL 1.3B до уровня LLM (~2020 год, ChatGPT выйдет через 2 года). Сравнение с Gemma3 1B 2025 года

продолжить чтение

habrGPT. Обучим LLM 0.5B с нуля на статьях Хабра с помощью nanochat от Карпатого. Обучение fp8 дома и сравнение с bf16

продолжить чтение

Как Claude научился файн-тюнить опенсорсные LLM

Claude получил возможность файн-тюнить языковые модели с помощью нового инструмента под названием Hugging Face Skills. Не просто писать скрипты для обучения, а реально отправлять задачи на облачные GPU, следить за прогрессом и пушить готовые модели на Hugging Face Hub. В этом туториале показано, как это работает и как использовать самому.Claude Code умеет использовать "скиллы" — упакованные инструкции, скрипты и доменные знания для выполнения специализированных задач. Скилл hf-llm-trainer

продолжить чтение