Нужна ли умная модель для рутины? Дал четырём моделям пять одинаковых задач и сравнил
На этой неделе на Хабре спорили, нужны ли программисту самые умные модели: «Я перестал пользоваться самыми умными ИИ‑моделями». Автор считает, что для рутины хватает дешёвых, а упирается всё теперь в скорость. Под статьёй почти триста комментариев. Я прочитал, наверное, половину: мнений много, замеров на одинаковых задачах не нашёл ни одного. Стало интересно, сел и проверил на своих.Что мерилВзял пять задач из тех, что обычно скидываю агенту и иду за кофе. Всё на Python, от одного до пяти файлов:Off-by-one в пагинации, тест падает, надо починить.
GigaChat 3.5 Reasoning — первая в России открытая модель с рассуждениями
Привет, Хабр. Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Веса и код запуска на huggingface, также модель можно попробовать в API и giga.chat.
Как с помощью graph RAG добиться многоходовых рассуждений от LLM с 2B весов
Пару недель назад YouTube подкинул мне пятиминутный ролик с небольшого канала, где автор демонстрирует преимущества RAG на графах над обычным RAG поверх корпуса текстов.Пример довольно простой. LLM должна ответить на вопрос: “Кто должен подписать возврат клиенту на 800 фунтов в марте?”. Ответ, естественно, содержится в предоставленных текстах, но для того, чтобы его добыть, нужно уметь в multi-hop reasoning, т.к. необходимая информация лежит в 3х разных местах:инструкциях по возврату средствсписке сотрудниковсообщениях электронной почтыДля правильного ответа (
Single Task Algorithmic Reasoning Models: как с помощью маленькой модели обойти большую LLM?
Привет, Хабр! Результаты коллег по цеху и наши исследования позволяют сделать однозначный вывод: в 2026-м для рецепта отличной reasoning-модели уже недостаточно лишь текстовых рассуждений. Для качественных ответов на большинство вопросов пользователей нужна работа с инструментами, мультимодальные режимы рассуждений, и нередко даже такая экзотика, как рассуждения в латентных представлениях сети.Мы рады поделиться с сообществом фреймворком для обучения рекурсивных reasoning-моделей STARM, существенно опережающих по качеству предыдущие open source-аналоги. О чём расскажем?
«Скопируй промпт дважды и получишь +76%». Я решил проверить
Всем привет. В декабре по всем AI-каналам пролетел лайфхак, который звучал как развод: продублируй свой запрос к нейросети, буквально Ctrl+C, Ctrl+V в одном сообщении, и точность вырастет. В пересказах фигурировали «+76%» и ссылка на Google Research, что придавало всей этой истории солидности. Трюк выглядел как-то настораживающе и при том вроде не сложным для проверки. Короче, я потратил $1.48, прогнал 3360 запросов и теперь знаю ответ. Он оказался интереснее, чем «работает || не работает».Что на самом деле написано в статьеИсточник это препринт Prompt Repetition Improves Non-Reasoning LLMs
Как думает LLM
Почему ChatGPT иногда может ответить мгновенно, а иногда заставляет смотреть на надпись Thinking почти минуту?На первый взгляд кажется, что модель стала умнее и теперь действительно размышляет перед ответом. А раз уж она размышляет, может модель обрела… самосознание? Конечно, это не так, модель не думает в привычном понимании, она строит несколько гипотез, находит и отбрасывает неудачные варианты и предоставляет пользователю ответ. Этот процесс сегодня называют Reasoning.
Reasoning-модели нужно измерять по-новому. Представляем публичный лидерборд MERA Reason
За последний год в мире больших языковых моделей произошел заметный сдвиг. Если раньше основным предметом соревнования были знания модели — насколько хорошо она отвечает на вопросы (общие или специальные), знает факты или пишет код, — то со временем фокус сместился на способность рассуждать.Практически каждый крупный релиз последних месяцев позиционируется как reasoning-модель. Производители говорят уже не столько о знаниях, сколько о способности строить длинные цепочки рассуждений, решать сложные задачи и принимать решения в условиях неопределенности.Но вместе с этим возникает закономерный вопрос:
Рефлексивный бот с долгой памятью: почему универсальный LLM-чат тут не работает, и как я переписал онбординг по данным
Я какое-то время использовал ChatGPT и Claude как собеседника для рефлексии — выгрузить, что в голове, посмотреть на себя со стороны. С самим разговором у них всё отлично. Проблема в другом: они со временем теряют память в целом управлять этим не сильно удобно из-за раздутого контекста.Для разовой задачи это норм. Но рефлексия — это процесс во времени: ценность не в одном разговоре, а в том, что собеседник помнит

