llm. - страница 45

llm.

Как запустить LLM на 2,8 трлн параметров на ноутбуке

Всем привет, меня зовут Сергей Прощаев, и в этой статье расскажу про то, как летом 2026 года большие языковые модели научились запускаться на железе, которое стоит под столом, а не в дата‑центре, и что из этого может забрать себе обычный backend‑инженер.Я Tech Lead и руководитель направления Java | Kotlin разработки в FinTech & E‑commerce и преподаю на курсах разработки и архитектуры в ОТУС.

продолжить чтение

Деградация безопасности при итеративной генерации кода с помощью ИИ (краткое изложение исследования)

На хабре почти ежедневно появляются статьи, типа “уволил программиста, теперь мне claude code / codex / … пишет”. Начинается спор, где с одной стороны восторженные фанаты вайб-кодинга, (которым раньше программист за месяц делал сайт в синей цветовой гамме, а сейчас нейронка за вечер - и на глаз цвет такой же), с другой скептики-луддиты. И все это каждый раз по тому же кругу. В этом не хватало каких-то твердых аргументов. И вот сейчас я нашел один такой (для луддитов). Исследование 2025 года, для конференции IEEE-ISTAS 2025.

продолжить чтение

[2-8] Autocompletion: как LLM создает подсказки кода

Дисклеймер. Я занимаюсь кодинговыми AI-ассистентами: начинал с автодополнения, сейчас работаю с агентами и внедрением AI в SDLC. Последние три года я регулярно выступаю с докладами и образовательными лекциями. За это время у меня накопилось много заметок о том, как устроены AI-ассистенты и агенты, написанных простым языком. Эта одна из них. Fill-in-the-Middle: как модель дописывает код в середине файла...В прошлой заметке мы разобрали Fill-in-the-Middle (FIM

продолжить чтение

Как собрать AI-контур на VPS: подписки ChatGPT и Claude, OmniRoute, LiteLLM и разработка без VPN

Думаю, практически каждый разработчик из России рано или поздно задавался вопросом: можно ли наконец перестать плясать с VPN и прокси, чтобы просто пользоваться нейросетями — и в собственных проектах, и непосредственно во время разработки?

продолжить чтение

DSL позволяют надежно использовать LLM

LLM генерируют код невероятно быстро, но чтобы гарантировать, что они создают именно то, что задумано, им нужны четкие границы. Абстракции и предметно-ориентированные языки (DSL) создают надежную оболочку, которая направляет LLM с самого начала. Пример Tickloom — предметной модели и DSL для иллюстрации поведения распределенных систем — показывает, как мы можем использовать LLM в качестве партнера для итеративного создания DSL и как естественно-языковой интерфейс для его использования. Такой DSL может выступать в качестве единственного источника истины для программных систем в мире LLM.

продолжить чтение

Книга: «LLM на практике. Большие языковые модели от идеи до внедрения»

Привет, Хаброжители!

продолжить чтение

Память агента без вектор-БД: 363 markdown-файла вместо эмбеддингов

У меня восемь агентов с постоянной памятью, и на всех вместе больше 360 файлов, около 1,4 МБ текста. Векторной базы нет ни одной: эмбеддинги я не считаю вообще.И это не “руки не дошли”. Схема работает с мая 2026 года: сначала на одном агенте, с июня централизованно на всех восьми. За это время вопрос про вектор-БД я поднимал трижды, каждый раз с конкретным кандидатом на внедрение, и каждый раз закрывал его отказом. Ниже разберу, как это устроено, какими числами живет и в какой момент перестанет работать.Рефлекс, от которого я отказался

продолжить чтение

Read‑only by construction: почему инструкции — не граница безопасности для AI‑агента в Kubernetes‑кластере

Всё чаще встречаю такую схему: берём LLM, даём ей доступ к kubectl или k8s API, в system prompt или подключённом skill‑е пишем что‑то вроде «ты можешь только читать, ничего не удаляй и не изменяй», и считаем вопрос закрытым. Прошёл через это сам и в какой‑то момент понял, что это не граница безопасности, а вежливая просьба.

продолжить чтение

Квантизация LLM: как запихнуть 70B модель в свою видюху

Ну что, думаете что для запуска LLaMA 3 70B вам нужна серверная стойка за лярд рублей? Поздравляю, вас обманули маркетологи GPU-вендоров. Модели с сотнями миллиардов параметров — LLaMA 3 70B, DeepSeek-V3 с его 671 лярдом параметров — жрут vRAM как не в себя, но есть способ запихнуть это все в обычную потребительскую видюху.Сегодня в статье разберем, как работает чудо квантизации под капотом, чем отличаются PTQ и QAT, почему MoE-модели (DeepSeek-V3, Mixtral, LLaMA 4 Scout) квантизовать сложнее и как выбрать между GPTQ, GGUF и AWQ.

продолжить чтение

Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота

К нам в лабораторию приехал человекоподобный робот ростом 173 сантиметра и весом 75 килограммов — и он не понимал по-русски ни слова. Штатный голосовой стек работал на китайском, лежал на закрытой плате внутри корпуса, куда нет доступа, и заменить в нём язык было нельзя. Пришлось строить собственный: своё распознавание речи, свой синтез голоса, свою логику диалога.

продолжить чтение