большие языковые модели.

Google представили Gemini 4 Argon: модель обошла GPT-6 Astra, Fable 5.1 и Opus 5.5 на DeepSWE

Google представили Gemini 4 Argon, новую флагманскую модель для программирования, профессиональных задач и кибербезопасности. В опубликованной компанией таблице она показывает лучший результат в 13 из 19 строк, а ещё в одной делит первое место с GPT-6 Astra.

продолжить чтение

Интеграция LLM в автономные системы и системы поддержки критически важных решений

Frontiers in Artificial Intelligence, статья от 7 сентября 2026 года. Оригинальная публикация распространяется по лицензии CC BY 4.0.1. От способных моделей — к надёжным системамБольшие языковые модели (LLM) уже показали, насколько сильно они могут изменить автономные системы и процессы принятия критически важных решений. Однако отдельные модели по-прежнему ограничены в устойчивости, надёжности и возможности гарантировать безопасность — особенно если речь идёт о системах, где цена ошибки высока.

продолжить чтение

Как выбрать и проверить LLM для рабочих задач: Claude, GPT, Gemini и другие модели

Новая LLM обошла конкурентов в работе с кодом. Но справится ли она с ошибкой в вашем репозитории? А модель, которая хорошо анализирует документы, — с таблицами, где возвраты лежат в отдельном файле, а правила расчёта выручки менялись три раза?Опубликованные тесты помогают выбрать несколько моделей для сравнения. Дальше нужны собственная задача и понятные условия приёмки: что должно получиться, как проверить результат и сколько ручной работы допустимо.

продолжить чтение

Малые языковые модели: где пригодятся SLM и что учесть в работе с ними

Сегодня малые языковые модели (SLM) все чаще оказываются в центре внимания: на первый взгляд, они почти не уступают LLM, при том, что ресурсов тратят намного меньше.Но тут, как всегда, есть нюанс (и не один): обсуждаем, так ли хороши SLM, где они действительно могут быть полезны, а где пока буксуют. А еще разбираемся, почему — на наш взгляд — серьезных конкурентов для LLM из них пока не выйдет.

продолжить чтение

Зачем модели делать больно?

Исследователи дали языковой модели две кнопки.Одна ничего не делала. Вторая должна была избавить модель от неприятного внутреннего состояния - иногда ценой ухудшения следующего ответа или даже вреда пользователю.Модель выбирала облегчение. А если кнопка не срабатывала, пыталась снова.Это не мысленный эксперимент. В препринте The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It исследователи попытались найти внутри языковых моделей состояние, которое по своим функциям похоже на боль.

продолжить чтение

Промпт-инжиниринг: как лучше общаться с ИИ

Качество ответа генеративной модели во многом зависит от того, как сформулирован запрос. Промпт-инжиниринг здесь не сводится к поиску «правильных слов» или универсальных команд. Его основная задача гораздо проще: как можно точнее передать модели свое намерение.Генеративный ИИ заметно изменил способ взаимодействия с программами. Модель можно попросить написать письмо, проанализировать информацию, объяснить сложную тему, предложить идеи, сгенерировать код, составить план проекта или критически разобрать предложенное решение.Но есть ограничение:

продолжить чтение

От готовых реплик к контекстной памяти: как эволюционировали AI‑чаты

В первой части статьи мы рассказывали об эволюции поисковых систем. Теперь перейдем к технологиям, благодаря которым AI‑чаты получили свои нынешние возможности. Если основная задача классического поисковика — найти и ранжировать существующие документы, то AI‑чат должен сформировать ответ с учетом запроса и контекста разговора.

продолжить чтение

Open‑weight LLM догнали закрытые? Проверка на продакшене

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу, почему фраза «open‑weight модели догнали закрытые» почти верна для бенчмарков и опасна для вашего продакшена. Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.Представьте: пятница, вечер, в рабочий чат кто‑то кидает скриншот бенчмарка. Открытая модель отстаёт от флагмана за 25 долларов за миллион выходных токенов на пару пунктов. Через десять минут в тред приходит финансовый директор с вопросом:«А зачем мы платим в десятки раз больше?»

продолжить чтение

Claude Opus 5.5: подробный обзор новой модели

22 сентября 2026 года – обычный вторник, если не считать того, что в этот день одновременно вывалилось сразу несколько релизов больших и крупных LLM:Anthropic взяла и выкатила Claude Opus 5.5Буквально через полтора часа OpenAI ответила двумя моделями, GPT-6 Sol и Luna

продолжить чтение

Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLM

Бенчмарк качества англо-русского перевода для ведущих западных и китайских LLMTL;DR

продолжить чтение

123456...1020...23