Путь к LangOps: руководство для начинающих
Примечание переводчика. Тема LangOps почти не освещена в русскоязычном интернете, поэтому я перевёл и публикую этот базовый гайд от Arthur Wetzel, CEO LangOps Institute. Оригинальная публикация вышла в закрытом сообществе LangOps Pros, перевод размещается с разрешения автора.
DevOps для языка: что такое LangOps
Примечание переводчика. Тема LangOps почти не освещена в русскоязычном интернете, поэтому я перевёл и публикую этот базовый гайд от Arthur Wetzel, CEO LangOps Institute. Оригинальная публикация вышла в закрытом сообществе LangOps Pros, перевод размещается с разрешения автора.
ML Q & AI. Глава 7. Парадигмы обучения на нескольких GPU
← Предыдущая глава | Какие существуют подходы к обучению на нескольких GPU и в чем их сильные и слабые стороны?Подходы к обучению на нескольких GPU можно разделить на две группы: разделение данных для параллельной обработки несколькими GPU и разделение модели по нескольким GPU для преодоления ограничений памяти, когда размер модели превышает возможности одной видеокарты. Параллелизм данных попадает в первую категорию, в то время как тензорный параллелизм и параллелизм моделей попадают во вторую. Такие подходы как
Анализ нарратива в Ведьмаке 3 (перевод статьи Дэвида Миллера и анализ видео)
Дэвид Миллер — профессор компьютерных наук в Саутгемптонском университете (Великобритания), работает в группе веб‑технологий. Его исследования связаны с гипертекстом, но в настоящее время большое внимание уделяет интерактивным повествованиям.Оригинальная статьяНачнём с главного: The Witcher 3 — это поразительно хорошая игра. Весёлая, увлекательная, огромная и достойная практически всех возможных хвалебных эпитетов, пока вы не «передозируетесь» комплиментами и не потянетесь за Белым Мёдом. Это действительно отличная игра.
ML Q & AI. Глава 6. Уменьшение переобучения при помощи настройки моделей
← Предыдущая глава |Допустим, мы обучаем классификатор при помощи обучения с учителем и уже применили к датасету различные методы для уменьшения переобучения. Как можно улучшить модель или цикл обучения, чтобы добиться еще более заметного эффекта?Наиболее эффективные методы борьбы с переобучением включают в себя различные техники регуляризации, такие как
Стирая языковые границы для NLP-датасетов
Всем привет. В этом посте расскажем, как мы тестировали БЯМ для переноса англоязычных датасетов на русский. «Мы» — это ваш покорный слуга и ребята из ФИЦ ИУ РАН. Пост по факту перевод нашей научной статьи, которая была опубликована еще в апреле, но вот руки до поста дошли только сейчас.
ML Q & AI. Глава 5. Уменьшение переобучения при помощи данных
← Предыдущая глава |Предположим, что мы обучаем классификатор при помощи обучения с учителем и замечаем, что он страдает от переобучения. Какие существуют основные подходы для уменьшения переобучения путем модификации или дополнения данных?Переобучение
Qwen3-MT — Alibaba выпускает еще одну модель для машинного перевода
Это обновление основано на мощной модели Qwen3, использующей триллионы многоязычных токенов и токенов для перевода, что позволяет значительно улучшить многоязычное понимание и возможности перевода модели. Благодаря интеграции методов обучения с подкреплением модель значительно повышает точность перевода и беглость речи.
ML Q & AI. Глава 4. Гипотеза о лотерейном билете
← Предыдущая глава |О чем говорит гипотеза о лотерейном билете, и чем она полезна на практике, если оказывается верной?Гипотеза о лотерейном билете — это идея, которая появилась в 2018 году в контексте обучения нейронных сетей. Она утверждает, что в случайно инициализированной нейронной сети существует подсеть (или «выигрышный билет»), которая, если ее обучить независимо, сможет достичь такой же точности на тестовом датасете, как и полная сеть после такого же количества шагов обучения. Авторы гипотезы — Джонатан Франкл и Майкл Карбин.

