llm. - страница 26

llm.

Добро пожаловать в эру AGI (по версии отдела маркетинга OpenAI)

3 сентября 2026 года в 19:49 по тихоокеанскому времени Сэм Альтман опубликовал твит о новой флагманской модели OpenAI. В твите — название модели, список задач, три цифры и обещание, что ожидание стоило того. Твит собрал 4,1 млн просмотров. В нём нет одного слова — того, вокруг которого потом развернулась вся полемика.Слова «AGI» в твите Альтмана не встречается ни разу.

продолжить чтение

Как 17B активных бьют 70B плотных: анатомия Mixture-of-Experts (MoE)

Если вдруг вы моргнули на моменте, когда разработчики нейросетей мерились у кого больше цифра рядом с названием модели, а выморгнув, обнаружили, что теперь модно флексить скромными размерами активных параметров, эта статья для вас. Сегодня объясняю, как же так произошло, что все флагманы опенсорса внезапно стали MoE, почему Qwen3.5 на 397 миллиардов параметров строчит токены, как будто ей 17 и почему никто не разорился на видеокартах.Ну и для тех, кому «только спросить» откроем тайну: в каком же кабинете у MoE живет эксперт по медицине.

продолжить чтение

I Gave an AI the Same 20 Coding Tasks With Short and Detailed Prompts — More Context Didn’t Always Produce Better Code

There is a habit I picked up after using AI for coding for a while. Whenever the generated code was not quite right, I added more context. Then a little more. Input formats, edge cases, performance requirements, error handling, preferred architecture, things the function should not do. Eventually a two-line request could turn into a small technical specification.It feels logical. A developer cannot read your mind, so why should an AI model be able to? More information should remove ambiguity and give better code. But after a few cases where a detailed prompt produced something strangely overengineered, I started wondering whether this assumption was actually true for small programming tasks.So I made a small experiment. I prepared 20 coding problems and sent every problem to the same model twice. The first version was intentionally short. The second explained almost everything I could reasonably explain without giving away the solution. There were 40 generated solutions in total. No follow-up messages, no asking the model to fix a failing test, no manually repairing imports. The first answer was the answer.

продолжить чтение

Решил проверить, правда ли все ищут AI-инженеров. Спойлер: 84% вакансий про ИИ молчат

Решил я на досуге посмотреть, а много ли на рынке сейчас требуется людей, владеющих AI-технологиями. Ощущение-то у всех одинаковое: ИИ везде, без него никуда, каждый второй пост в ленте про агентов. А что на рынке труда?Спарсил я значит hh.ru (не без помощи LLM), все активные вакансии в 25 категориях направления «Информационные технологии» по России — получилось 34 053 штуки. Дальше посчитал, в скольких из них вообще упоминаются языковые модели и смежные вещи: LLM, GPT, RAG, агенты, промпты, Cursor, LangChain, GigaChat и ещё пара десятков терминов. Отдельно — сколько разобрал по полному тексту описания: 853 вакансии.Сколько всего

продолжить чтение

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо: загрузить веса, поднять runtime, отдать API, подключить приложение.Теорию я понимал. Но честный ответ был таким: собственного опыта, в котором всё это проходит путь от файлов модели до работающего пользовательского сценария, у меня тогда не было.Через несколько дней такой опыт появился.

продолжить чтение

DLP для LLM: как обезличивать запросы и не ломать поиск по сотрудникам

Меня зовут Андрей Непряхин, я технический директор AGIMA. В AGIMA мы строим внутренний контур, через который сотрудники работают с LLM и агентами. Одна из самых неприятных задач в таком контуре — не просто спрятать имя или телефон перед отправкой запроса во внешнюю модель, а сохранить смысл запроса. Представьте: сотрудник пишет «найди последние задачи Петрова по проекту X и сравни их с обсуждением на встречах». Если заменить Петрова на NAME_1, а в соседнем сообщении — на случайный NAME_7

продолжить чтение

GuardRate: метрики, бенчмарки и инсайты из первого аудита (часть 2)

В первой части мы верхнеуровнево рассмотрели результаты оценки 37 моделей, обсудили проблему оценки и сравнения guardrail моделей, рассказали, как лидерборд помогает с ней справиться, а также поделились инсайтами и руководством по использованию.  Теперь пришло время заглянуть во внутреннюю кухню: в этой статье мы подробно разберем устройство GuardRate Tool и GuardRate Leaderboard, ответим на вопрос, почему выбрали именно такие бенчмарки и метрики, опишем методологию и расскажем о том, как проводились эксперименты.Архитектура: как устроен прогон

продолжить чтение

AGI Benchmark. If ARC-AGI-3 is solved, do we have AGI?

Benchmarks exist so that engineers can test their projects, observe competitors, and compare their performance. Each benchmark serves a specific purpose.ARC-AGI-3 was created by the ARC Prize Foundation, founded by François Chollet, to evaluate general intelligence and the learning capabilities of AI agents. The premise behind its complex, game-like interactive tasks was that they could only be solved by an artificial intelligence capable of exploring an unfamiliar environment, grasping rules on the fly, planning actions, and adapting to new conditions. In other words, an AI that truly knows how to learn.A number of projects claim a 100% success rate on this benchmark. But this is not a victory. In this article, I will explain why.What is ARC-AGI-3

продолжить чтение

Excel, 3 маркетплейса и 170 часов рутины — как я автоматизировал работу e-commerce команды

Автоматизацию бизнеса часто обсуждают в контексте замены сотрудников: вот сейчас подключим AI, сократим отдел поддержки в три раза и получим экономический эффект.На практике мне гораздо интереснее другой класс задач.Есть сотрудники, которые умеют анализировать продажи, работать с ассортиментом, рекламой и клиентами. Но несколько часов каждого рабочего дня они тратят на то, чтобы переносить данные из одной системы в другую или в сотый раз писать почти одинаковый ответ покупателю.Один из проектов, над которым я работал, как раз оказался таким.

продолжить чтение

А зачем искусственному интеллекту душа? Филологический разбор манифеста Никиты Михалкова

Недавно Никита Михалков, помимо обычного «гона Бесов» — пусть будут с большой буквы, как у Достоевского, — высказался ещё и об искусственном интеллекте. С мыслью, которую он, как всегда, талантливо и красочно преподнёс, спорить трудно. Михалков заявил, что, если искусственный интеллект заменит естественный, искусство потеряет всякий смысл, ведь у «машины», как он по инерции окрестил ИИ, нет «ни совести, ни души, ни сострадания, ни страха, ни любви». С первой частью этого утверждения я готов согласиться почти безоговорочно, но переход ко второй кажется мне далеко не столь очевидным.

продолжить чтение