llm.
Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизация
На NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA. Почему инференс LLM дорогой и какие оптимизации помогают его ускорять.В этой статье - чеклист по архитектурам LLM и оптимизации инференса с картинками и схемами. Это не полноценная лекция с нуля, а тренажёр перед техническим интервью: пройтись по ключевым определениям, увидеть типовые вопросы и закрыть пробелы в формулировках.Содержание:
Один запрос, семь ИИ-поисковиков, ноль общих источников
Когда человек спрашивает у ассистента «к кому обратиться», он не получает десять синих ссылок. Он получает ответ, внутри которого названы пять-десять доменов. Для бизнеса это новая выдача, и вопрос к ней другой, чем к обычному поиску: не «какая у меня позиция», а «я вообще есть в этом ответе».Я меряю это программно: беру запрос, задаю его нескольким движкам и смотрю не на текст ответа, а на то, какие домены движок реально процитировал. 10 августа 2026 года я прогнал два запроса через семь движков в один заход. Пересечение получилось пустым: ни одного домена, который назвали бы все семеро.
2160 раундов симуляции без кнопки «стоп». Исследование MiroFish, часть 3
Третья, заключительная статья об исследовании MiroFish, открытого стека мультиагентной симуляции общества. В первой части изложены методология и находка Silent Failure; во второй слепота отчёта, управляемая графом. В этой части: как одна фраза запроса превращается в конфигурацию запуска, что систему ограничивает на длинной дистанции, и общая карта находок серии.
Голос из машины
Эссе1. Когда машина говоритЕсть в общении с современными нейросетями странность, которая особенно заметна в голосовом режиме. Человек слышит интонации, паузы, смех, мгновенную реакцию на шутку. Он спорит, задаёт вопросы, возвращается к прежним темам. Система удерживает контекст и отвечает так, что разговор легко воспринимается как встреча с собеседником.При этом рационально всё понятно: перед нами не человек. Это вычислительная система, и у нас нет надёжных оснований считать, что за её словами существует субъективная жизнь, похожая на человеческую.
Qwen3.8 Max вышла: выше Claude Fable 5 в агентном индексе при цене $6 за миллион токенов
Финальная модель Alibaba получила миллион токенов контекста, независимые оценки и очень серьёзную цену. Проверяем, что осталось от июльских обещаний и где всё ещё приходится ждать.
Приручить цифровых чертей: как я собрал тренажёр по софт-скиллам на LLM
Рандом жульничал, ведущий жалел игрока, а сцены скучали — рассказываю, как строил MVP и почему теперь прошу вас его сломать.
Я объяснил KERNEL маме за пять минут. Потом проверил, переживёт ли он LLM в production
Почему хороший промпт подозрительно похож на техническое задание и где заканчивается prompt engineering, а начинается настоящая работа с LLMоригинальный пост в r/PromptEngineering
Диффузионные языковые модели: как устроены, что в них работает, а что вызывает вопросы
Привет, Хабр. На связи команды «Интерпретируемый ИИ» и «Основы генеративного ИИ» AIRI и «Генеративная поэзия» SberAI. Мы занимаемся альтернативными архитектурами языковых моделей — тем, что могло бы работать вместо привычной генерации токен за токеном слева направо.Одно из таких направлений — диффузионные языковые модели (dLLM). Диффузионные языковые модели, в отличие от обычных LLM, генерируют текст параллельно, несколько токенов за раз. Теоретически это даёт кратное ускорение. Также они не ограничены генерацией справа от контекста и могут заполнять произвольные пропуски в поданном на вход тексте.
Небольшой интерфейс + агентная сетка для решения задач исследований в продуктовой аналитике
Приветики, меня зовут Пётр и я продуктовый аналитик с коммерческим опытом в ПА около 12 лет. В моей работе глобально задачи делятся на 3 типа -- разметка событий, аб-тесты и продуктовые рисерчи.Про разметку я уже писал тут https://habr.com/ru/articles/785320/Под аб-тесты мы с корешами собрали коммерческий воркспейс (зарегайтесь, потестите, это бесплатно (длинно и не обрезано) если не нужны командные фичи). Было тут: https://habr.com/ru/articles/1064034/

