LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты
В одном из проектов я строил систему оценки ответов с двумя контурами. Первый был скучным и предсказуемым: нормализовать результат и сравнить его с эталоном. Второй использовал LLM как судью и оценивал смысл ответа целиком.Каппа Коэна
OpenAI открыла доступ к Health in ChatGPT для всех совершеннолетних пользователей США
Health in ChatGPT — это отдельное пространство внутри ChatGPT с усиленными механизмами защиты данных. Пользователи могут импортировать сведения из медицинских порталов, лабораторные результаты, выписки после приема, страховые документы, а также данные из Apple Health и ряда сервисов для отслеживания физической активности и питания. После этого ChatGPT отвечает на вопросы с учетом загруженной информации. Например он может объяснить показатели анализов, помогает подготовить список вопросов врачу или интерпретировать динамику сна и физической активности.
В Конгресс США внесли законопроект, позволяющий властям замедлять и отключать системы ИИ
В Палату представителей США внесли документ под названием «Закон о выключателе ИИ» (AI Kill Switch Act), который обяжет разработчиков нейросетей сохранять возможность для властей замедлять, приостанавливать и отключать работу своих языковых моделей. Законопроект представили члены нижней палаты американского парламента демократ Тед Лью и республиканец Натаниэль Моран.
Reasoning-модели нужно измерять по-новому. Представляем публичный лидерборд MERA Reason
За последний год в мире больших языковых моделей произошел заметный сдвиг. Если раньше основным предметом соревнования были знания модели — насколько хорошо она отвечает на вопросы (общие или специальные), знает факты или пишет код, — то со временем фокус сместился на способность рассуждать.Практически каждый крупный релиз последних месяцев позиционируется как reasoning-модель. Производители говорят уже не столько о знаниях, сколько о способности строить длинные цепочки рассуждений, решать сложные задачи и принимать решения в условиях неопределенности.Но вместе с этим возникает закономерный вопрос:
Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1
Сколько времени вам, человеку, нужно, чтобы сложить футболку? Секунд пять, если аккуратно и секунд десять, если прям вообще аккуратно.А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы робот сложил ту же футболку сам — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины?Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.
Своя GPT-like LLM по WH40K с нуля. Часть 4: Дообучение на вопрос–ответ (SFT)
Привет, Хабр! Меня зовут Владимир, и это четвёртая часть цикла статей по написанию и обучению небольшой decoder-only LLM с нуля. В третьей части мы собрали LinguaLaboratoriumMechanicus, обучили base-модель на корпусе данных по Warhammer 40K и получили модель, которая умеет продолжать текст. Данная статья целиком посвящена этапу SFT - дообучению на датасете “вопрос - ответ”, чтобы модель могла вести диалог с пользователем, а не просто дописывать за него фразы.Содержание циклаПодготовка и токенизация данныхТрансформер

