Как собрать персональную wiki без Claude Code
Идея Andrej Karpathy с LLM-wiki набирает сторонников. На Хабре уже было несколько публикаций (1, 2, 3), в том числе и моя про сравнение LLM-wiki и RAG-системы. Ещё больше статей я нашёл на medium.
Как я Zabbix с LLM дружил в свободное время. Архитектурный обзор взаимодействия с нейросетью. Часть 4 «Реализация»
У всех лапкиЭто заключительная статья цикла о том, как при четко поставленной задаче, заранее сформированном ТЗ, продуманном HLD и детальном LLD можно получить от нейросети не набор случайных скриптов, а вполне рабочий self-hosted сервис.
Хватит сливать данные в Claude и GPT: как поднять свой on‑prem LLM
Да, вы абсолютно правы ✅ Это изображение подходит в вашу статью ✅ Будут еще вопросы, обращайтесь 😊
Один интерфейс — девять LLM-провайдеров: как мы подружили Kimi K3, GLM-5.2, Claude и Ollama в одном терминальном агенте
Привет, Хабр! Я делаю execai — терминальный AI-агент на Go (bubbletea), в духе Claude Code. Он читает файлы, гоняет shell-команды, ходит в kubernetes и стримит ответы в TUI.В какой-то момент выяснилось, что пользователям нужен не «агент с одной моделью», а мультитул: у кого-то подписка Kimi Code за $19, у кого-то GLM Coding Plan за $18, у кого-то корпоративный ключ Anthropic, а кто-то хочет гонять Ollama локально и не платить вообще. И всё это — в одном чате, с общей историей, с переключением на лету.
Как я искал идеальный промпт для сопроводительных писем (и что оказалось важнее модели)
Моё приложение пишет сопроводительные письма к вакансиям на hh либо локальной моделью через Ollama, либо облачным API. Акцент в разработке я хотел сделать на локальную модель, потому что это просто-напросто бесплатно. Один вопрос портит красивую картину: а маленькая локальная модель вообще умеет писать так, чтобы не стыдно отправить работодателю?Я по умолчанию считал, что качество упирается в мощность модели и большая облачная всегда обгонит маленькую локальную. Чтобы проверить это на цифрах, а не на ощущениях, я собрал слепую оценку. За несколько заходов она показала, что рычаг, за который я тянул, был вообще не тот.
«Свой» уходит в опенсорс: вайб-темы, RAG поверх шифра и объектив, который знает контекст
Прошлая статья про «Свой» заканчивалась вопросом: что вообще делать с этим проектом — добивать и выкладывать в опенсорс, тянуть в «серую зону» на зарубежных моделях, или забыть. В итоге: я разобрался с 152-ФЗ, зарегистрировал все необходимые документы на обработку ПДн и трансграничную передачу и выложил проект в OpenSource.- основное приложение: https://github.com/Zazza/svoi-oss - внешний RAG (про него ниже — отдельная история): https://github.com/Zazza/svoi-oss-rag Лицензия — AGPL-3.0.
Теги реакций и собираемый промпт: как удержать характер ИИ-персонажа по ходу диалога
ПредысторияПоследние полгода с лишним я занимаюсь работой с LLM и созданием ИИ-персонажа. За это время я столкнулся с множеством проблем, решением которых хотел бы поделиться и, возможно, посоветоваться.Кому подойдёт эта статьяТем, кто хочет создавать прописанных персонажей для RP или ИИ-компаньоновЭнтузиастам, что хотят оживлять популярных персонажей из игр/комиксов/анимеИИ-энтузиастамНачало опытовКогда я только начал попытки создания своего пет-проекта с ИИ, я столкнулся с проблемой — вектор диалога меняется каждый ход и в конце концов становится неуправляемым.
Написал локального ИИ-ассистента для зумов: диаризация, граф знаний и ноль облаков
Полгода назад я прикинул, сколько рабочих созвонов ежедневно улетает на чужие сервера через модные ИИ-ноутейкеры. Стало как-то неуютно. Otter, Granola, Fireflies — все льют разговоры в облако. Granola в этом году вообще отличилась: The Verge раскопали, что заметки по дефолту доступны любому по ссылке, а на пользовательских данных крутят модели (opt-out ожидаемо зарыт в Enterprise-тарифе).Решил проверить, можно ли собрать ассистента целиком на своём железе. Спойлер: можно. Работает каждый день на M1 Max под Apache 2.0.Что получилось
Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen
Об открытых языковых моделях написано много — и почти все статьи посвящены знакомству, в лучшем случае — «медовому месяцу» использования. Бенчмарки, рейтинги «лучших моделей года», полевые тесты на одной задаче, руководства. Гораздо реже говорят, что происходит потом: как ведет себя модель спустя месяцы непрерывной работы, где и почему начинает сбоить, что ломается под нагрузкой и какие инженерные решения постепенно вытесняют первоначальные представления о том, «как надо». В WB-Tech

