llm.
Как запустить LLM на 2,8 трлн параметров на ноутбуке
Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про то, как летом 2026 года большие языковые модели научились запускаться на железе, которое стоит под столом, а не в дата‑центре, и что из этого может забрать себе обычный backend‑инженер.Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.
Деградация безопасности при итеративной генерации кода с помощью ИИ (краткое изложение исследования)
На хабре почти ежедневно появляются статьи, типа “уволил программиста, теперь мне claude code / codex / … пишет”. Начинается спор, где с одной стороны восторженные фанаты вайб-кодинга, (которым раньше программист за месяц делал сайт в синей цветовой гамме, а сейчас нейронка за вечер - и на глаз цвет такой же), с другой скептики-луддиты. И все это каждый раз по тому же кругу. В этом не хватало каких-то твердых аргументов. И вот сейчас я нашел один такой (для луддитов). Исследование 2025 года, для конференции IEEE-ISTAS 2025.
[2-8] Autocompletion: как LLM создает подсказки кода
Дисклеймер. Я занимаюсь кодинговыми AI-ассистентами: начинал с автодополнения, сейчас работаю с агентами и внедрением AI в SDLC. Последние три года я регулярно выступаю с докладами и образовательными лекциями. За это время у меня накопилось много заметок о том, как устроены AI-ассистенты и агенты, написанных простым языком. Эта одна из них. Fill-in-the-Middle: как модель дописывает код в середине файла...В прошлой заметке мы разобрали Fill-in-the-Middle (FIM
Как собрать AI-контур на VPS: подписки ChatGPT и Claude, OmniRoute, LiteLLM и разработка без VPN
Думаю, практически каждый разработчик из России рано или поздно задавался вопросом: можно ли наконец перестать плясать с VPN и прокси, чтобы просто пользоваться нейросетями — и в собственных проектах, и непосредственно во время разработки?
DSL позволяют надежно использовать LLM
LLM генерируют код невероятно быстро, но чтобы гарантировать, что они создают именно то, что задумано, им нужны четкие границы. Абстракции и предметно-ориентированные языки (DSL) создают надежную оболочку, которая направляет LLM с самого начала. Пример Tickloom — предметной модели и DSL для иллюстрации поведения распределенных систем — показывает, как мы можем использовать LLM в качестве партнера для итеративного создания DSL и как естественно-языковой интерфейс для его использования. Такой DSL может выступать в качестве единственного источника истины для программных систем в мире LLM.
Книга: «LLM на практике. Большие языковые модели от идеи до внедрения»
Привет, Хаброжители!
Память агента без вектор-БД: 363 markdown-файла вместо эмбеддингов
У меня восемь агентов с постоянной памятью, и на всех вместе больше 360 файлов, около 1,4 МБ текста. Векторной базы нет ни одной: эмбеддинги я не считаю вообще.И это не “руки не дошли”. Схема работает с мая 2026 года: сначала на одном агенте, с июня централизованно на всех восьми. За это время вопрос про вектор-БД я поднимал трижды, каждый раз с конкретным кандидатом на внедрение, и каждый раз закрывал его отказом. Ниже разберу, как это устроено, какими числами живет и в какой момент перестанет работать.Рефлекс, от которого я отказался
Read‑only by construction: почему инструкции — не граница безопасности для AI‑агента в Kubernetes‑кластере
Всё чаще встречаю такую схему: берём LLM, даём ей доступ к kubectl или k8s API, в system prompt или подключённом skill‑е пишем что‑то вроде «ты можешь только читать, ничего не удаляй и не изменяй», и считаем вопрос закрытым. Прошёл через это сам и в какой‑то момент понял, что это не граница безопасности, а вежливая просьба.
Квантизация LLM: как запихнуть 70B модель в свою видюху
Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

