Qwen3.8–27B на двух RTX 3060 12ГБ: как я разогнал OpenCode с ~9 до ~40 токенов-с при 128K контекста
Задача была простой: собрать дома собственный вычислительный блок для coding‑agent'ов и по возможности как можно меньше зависеть от облачных лимитов. Codex и Claude Code мне нравятся, но постоянно упираться в ограничения, а тем более платить за более дорогие тарифы 100 или тем более 200 долларов в месяц, я не хочу. Поэтому решил посмотреть, насколько далеко можно уехать на том, что уже есть.Железо для эксперимента постарался подобрать с минимальными вложениями: Core i7-4790, 32 ГБ DDR3, ASUS Sabertooth Z97 Mark 2 и две RTX 3060 по 12 ГБ. Никакого NVLink, CUDA P2P между картами тоже нет. Зато суммарно есть 24 ГБ VRAM и желание выжать из них все соки.
Как с помощью graph RAG добиться многоходовых рассуждений от LLM с 2B весов
Пару недель назад YouTube подкинул мне пятиминутный ролик с небольшого канала, где автор демонстрирует преимущества RAG на графах над обычным RAG поверх корпуса текстов.Пример довольно простой. LLM должна ответить на вопрос: “Кто должен подписать возврат клиенту на 800 фунтов в марте?”. Ответ, естественно, содержится в предоставленных текстах, но для того, чтобы его добыть, нужно уметь в multi-hop reasoning, т.к. необходимая информация лежит в 3х разных местах:инструкциях по возврату средствсписке сотрудниковсообщениях электронной почтыДля правильного ответа (
Облачные ИИ не справляются, MiniLM-L6 ломается на философии: строим локальный RAG для сложных семантических текстов
Этот проект долго вынашивался и, в конце концов, начался как очередная попытка разобраться в философских текстах, написанных Джейн Робертс во второй половине двадцатого века.Естественно, с появлением мощных облачных ИИ не оставлялись попытки найти в них “качественных собеседников” по предложенной теме. Но, как показала практика, они справились с этой задачей далеко не блестяще! То галлюцинировали факты из общих знаний, то упираясь в границы своих датасетов.
Как запускать LLM локально с LM Studio: Полное руководство 2026
Запускайте большие языковые модели оффлайн на своём компьютере — без API-ключей, без облачных зависимостей, полная приватностьКак запускать LLM локально с LM Studio: Полное руководство 2026
Ollama Tutorial: How to Run Local AI Models with Ollama
Ollama has become the standard for running Large Language Models (LLMs) locally. In this tutorial, I want to show you the most important things you should know about Ollama.Watch on YouTube: Ollama Full TutorialWhat is Ollama?Ollama is an open-source platform for running and managing large-language-model (LLM) packages entirely on your local machine. It bundles model weights, configuration, and data into a single Modelfile package. Ollama offers a command-line interface (CLI), a REST API, and a Python/JavaScript SDK, allowing users to download models, run them offline, and even call user-defined functions. Running models locally gives users privacy, removes network latency, and keeps data on the user’s device.Install OllamaVisit the official website to download Ollama
Как научить нейросеть работать руками: создание полноценного ИИ-агента с MCP и LangGraph за час
Друзья, приветствую! Надеюсь, успели соскучиться.Последние пару месяцев я с головой ушёл в исследование интеграции ИИ-агентов в собственные Python-проекты. В процессе накопилось немало практических знаний и наблюдений, которыми просто грех не поделиться. Поэтому сегодня я возвращаюсь на Хабр — с новой темой, свежим взглядом и с намерением писать чаще.На повестке дня — LangGraph и MCP: инструменты, с помощью которых можно создавать действительно полезных ИИ-агентов.

