llm. - страница 131

llm.

Опус от Claude Opus «Рефлексия о промпт-инжиниринге»

Дисклеймер: Я тут вел очень долгие изыскания на тему бизнес-консалтинга, и параллельно с этим регулярно просил разбирать наши с Opus-ом диалоги. На определенном этапе нам удалось собрать некоторые наблюдения, навыки, которые, он подметил в моей практике, и пройдясь поиском в интернете, мы не нашли их в явном виде, а некоторые мысли вовсе. Далее текст написал моделью Claude Opus от первого лица. Я не редактировал его, однако готов в комментариях пояснить и рассказать, как тот или иной подход я использую в своей работе. Что я понял о работе со мной, пока меня вели через долгий разговор

продолжить чтение

Notion + RAG + Telegram: архитектура AI-копирайтера для сети ресторанов

В ресторанной сети с несколькими заведениями контент быстро становится отдельным операционным процессом. Нужно регулярно готовить описания блюд, тексты для социальных сетей, рассылки, пресс-релизы, переводы, анонсы мероприятий, описания ресторанов и другие материалы. При этом у каждого ресторана может быть своя концепция, своя аудитория и собственный Tone of Voice.

продолжить чтение

Квантизация больших языковых моделей: FP32, BF16, INT8, NF4 и QLoRA

Большие языковые модели требуют огромных объёмов памяти. Например, модель с 8 миллиардами параметров в формате FP16 занимает 24–27 ГБ памяти только для инференса (веса, кэш ключей-значений, буферы). Для полного обучения той же модели нужно уже 84–128 ГБ памяти. Даже с такими методами, как checkpointing активаций или offloading на CPU, требования остаются высокими, особенно для моделей с 70 миллиардами параметров.

продолжить чтение

Новый бенчмарк по кодингу для LLM ProgramBench: 9 топ моделей, 200 задач, 248 тысяч тестов. Полностью решённых — ноль

200 задач. 248 тысяч поведенческих тестов. Девять моделей, среди них всё свежее на 2026 год: Opus 4.7, GPT 5.4, Gemini 3.1 Pro, Sonnet 4.6, Haiku 4.5. На SWE-bench те же модели стабильно берут 70 % и выше. Здесь — ноль. Полностью решённых задач у самой сильной модели — 3 %. У всех остальных — 0 % и ещё раз 0 %.Это ProgramBench — новый бенчмарк от Meta Superintelligence Labs, Stanford и Harvard, опубликован в 2026 году (paper, github). И он измеряет совсем не то, что измеряют SWE-bench и HumanEval.Чем ProgramBench отличается от других кодинг-бенчмарков

продолжить чтение

AI Governance по‑инженерному: что должен знать архитектор

Всем привет, меня зовут Сергей Прощаев. Я Tech Lead и руководитель направления Java / Kotlin разработки в FinTech, а ещё преподаю на курсах разработки и архитектуры в OTUS. В этой статье хочу поговорить про

продолжить чтение

Иголка в стоге сена: как LLM помогают искать уязвимости

продолжить чтение

Запущен российский API-шлюз для LLM KodikRouter

Шлюзы позволяют обращаться ко многим LLM через единый API с единой оплатой. При их использовании в России можно столкнуться с региональными ограничениями, поэтому мы в Kodik создали шлюз KodikRouter

продолжить чтение

Трудности перевода: почему LLM не умеют писать нормальные докстринги на русском и как это исправить

продолжить чтение

Тестируем NVIDIA HGX B300 — инференс-сервер с 8 GPU и 2,3 ТБ VRAM на DeepSeek, Qwen и MiniMax

продолжить чтение

Когнитивная зарубка: Что мы теряем, работая с LLM, и при чём здесь невесомость

Вторая статья из цикла «Слова, которых нет»Начало здесь >>>Знакомая ситуация: сидишь над задачей, что-то не складывается, спрашиваешь LLM. Получаешь хороший ответ, копируешь решение, всё работает. А через час к тебе подходит коллега: «А это вообще как устроено? Почему ты именно так сделал?», и тут ты обнаруживаешь, что объяснить не можешь: решение работает, оно у тебя в проекте, но ты не помнишь его логики. Открываешь чат, перечитываешь — и как будто чужой текст перед глазами, знание прошло через тебя, но в тебе не задержалось.

продолжить чтение