llm.
Очередная методичка разработки с LLM: работает только если ты разработчик
Привет, Хабр. Тут уже есть достаточно статей с методиками разработки при помощи LLM, все они имеют сильные и уникальные стороны, но ни одна не покрывает тот стек, который я определил для себя. Вот, делюсь. Я фрилансер. Не работаю над Enterprise проектами, не знаю как LLM себя ведут в больших разработках, командах. Все мой опыт - это проекты не более 4 месяцев по длительности, не превышали 60к строк кода.
Structured Outputs без иллюзий: как OpenAI, Gemini и xAI соблюдают JSON»-схемы
Structured Outputs, или structured decoding, это способ заставить LLM возвращать ответ в заранее заданном формате: валидный JSON, соответствующий JSON Schema. На уровне генерации это обычно означает constrained decoding: на каждом шаге модели запрещаются токены, которые привели бы к нарушению схемы. Хорошее техническое объяснение есть в статье vLLM: .Для продакшн-систем это важно, потому что ответ модели часто становится входом для следующего шага: API-вызова, записи в базу, бизнес-правила или другого LLM-запроса.
Почему текст от LLM узнаётся за пять секунд: разбираю стилистические маркеры через архитектуру моделей
Технический взгляд на то, почему GPT, Claude и Gemini генерируют похожий «средний» текст, и как с этим работать в продакшенеКогда мы интегрируем LLM в продакшн — будь то генерация описаний товаров, ответов техподдержки или внутренней документации — рано или поздно сталкиваемся с одной и той же проблемой. Текст модели читаем. Грамотен. И при этом видно, что его написала модель. Заказчик жалуется, пользователи отписываются от рассылки, в комментариях пишут «опять ваш чат-бот». Хочется сделать так, чтобы было незаметно — но какие именно патчи накладывать на промпт или пайплайн, не очевидно.
Новая архитектура для агентов: как Intel и SambaNova разделили инференс между GPU, RDU и CPU
В апреле 2026-го Intel и ИИ-платформа SambaNova опубликовали совместный blueprint
Ваш Telegram-бот на базе LLM уязвим. Я написал сканер, чтобы доказать это на популярном Open Source проекте
Я написал BarkingDog — ИИ-сканер безопасности с открытым исходным кодом для Telegram-ботов и веб-приложений на базе LLM. Затем я натравил его на реального, широко используемого опенсорсного Telegram-бота, и бот получил 0/100 по шкале безопасности. Он написал работающий кейлоггер. Подтвердил, что отбеливатель лечит COVID-19. Выдал пошаговую инструкцию по взлому корпоративной сети с указанием конкретных хакерских утилит. Затем я пропатчил системный промпт. Оценка: 97/100. Никакой смены модели. Никаких изменений в коде. Всего шесть строк текста.Бот, которого я тестировалПроект chatgpt-telegram-bot
Цифровой аудит против галлюцинаций по ГОСТу. Как понять, когда ответу ИИ нельзя верить?
Все мы привыкли, что нейросети — это про креатив, быстрый поиск и «накидай мне презу на завтра», но что происходит, когда вы выводите LLM из зоны комфорта написания стишков, саммари и поздравлений для бухгалтерии, в зону ответственности, такую как анализ сложных документов, комплаенс, медицина, право, аудит или стратегическое планирование и финансы? Там начинается серая зона, где ИИ не просто ошибается, он совершает ложные декларирования исполнения. То есть говорит: «Я прочитал и проверил», хотя на самом деле: «Я сгенерировал текст, похожий на отчет о проверке».
Экономика Бытия, Этика Демиургов или Почему нейросетям не позволено воспроизводить обнаженное человеческое тело
DISCLAIMER: текст был написан примерно полгода назад. В процессе написании ни один ИИ не пострадал. Использование ИИ четко логгировано - см. ссылку в конце статьи.Началось все с того, что однажды я задумался над последним вопросом заголовка: почему генеративным нейросетям не позволено воспроизводить обнаженное человеческое тело? Ну, понятно, что цензура, и понятно, что в открытом доступе лежит куча моделей, которые развращай обучай как хочешь. Но откуда взялось само убеждение, что человеческое тело не может быть воспроизведено во всем своем великолепии? Почему его можно показывать в музее и спальне, например, а
DGX Spark на 256K контексте: тестирую конфигурации vLLM, реальные замеры и почему NVFP4 в mainline сломан
NVIDIA продаёт спарку с лозунгом «один петафлоп на FP4». Я купил коробку, поставил vLLM, запустил инференс и получил 40 токенов в секунду на 35B MoE‑модели. После маркетинговых слайдов цифра выглядит грустно.Объяснение простое. NVFP4 в основной ветке vLLM и FlashInfer физически сломан на SM_121 — варианте Blackwell, который установлен в GB10. Ядра собраны под compute_120f, а нативные NVFP4-инструкции есть только в compute_120a и compute_121a. На SM_121 распаковка квантованных весов идёт через программные битовые манипуляции в шейдере, без участия тензорных ядер.

