llama.cpp.

Тест локальных MOE моделей

продолжить чтение

Как я смог запустить 32b модель и сделать ее умнее в два раза на 3050

ПРЕДУПРЖДЕНИЕ : Автору 14 лет он плохо разбираеться в технологиях и программировании но основную теорию проекта придумал сам очень хотелось бы услышать критику конструктивнуюВсем здрайвствуйте я Titled и я создал форк llama.cpp где реализовал все свои жаветные мечты сейчас расскажу что это было и почему я написал такооой длиный заголовок.

продолжить чтение

Как я ужал русский эмбеддер до 24 млн параметров — и чуть не испортил его одной цифрой

TL;DR.

продолжить чтение

Дообучил pretrain ruGPT3 XL 1.3B до уровня LLM (~2020 год, ChatGPT выйдет через 2 года). Сравнение с Gemma3 1B 2025 года

продолжить чтение

Как мы запустили Ornith‑35B на ноутбуке с 8 ГБ VRAM и разогнали её до 99 ток-с на AMD Strix Halo

Согласно опубликованным бенчмаркам, Ornith‑1.0‑35B показала себя лучше Qwen3.5‑397B‑A17B в тех тестах, где модель должна не просто написать код, а самостоятельно работать в терминале и пользоваться инструментами. На Terminal‑Bench 2.1 с Terminus‑2 разница составила 64,2% против 53,5%.BenchmarkOrnith‑1.0‑35BQwen3.5‑397BOrnith − QwenTerminal‑Bench 2.1, Terminus‑264,253,5+10,7Terminal‑Bench 2.1, Claude Code62,848,6+14,2SWE‑bench Verified

продолжить чтение

Мини‑ПК на Strix Halo под параллельной нагрузкой: 236 tok-s на 32 одновременных запросах и три ошибки

продолжить чтение

Запуск и оптимизация локальной LLM с llama.cpp

Автор статьи - Даниил Г., Python-разработчикВступление

продолжить чтение

Как я обучил русский RAG‑сплиттер, который режет документы по индексам, а не по тексту

TL;DR. Из интереса обучил собственный русский RAG‑сплиттер — захотелось проверить, можно ли сделать context‑aware‑нарезку русских документов лучше готовых чанкеров.Я взял идею датской context-aware-splitter, пересобрал её под русский на базе T-lite-it-2.1 и изменил главное: модель возвращает индексы границ, а не переписанный текст. Хост потом режет оригинал по этим индексам.У index‑output оказалось три практических плюса:СвойствоЧто получаетсяLossless‑нарезкачанки совпадают с исходником байт‑в-байт

продолжить чтение

Тесты бюджетных сборок для ИИ до 100к рублей

GPU для локального ИИ достаточно дорогие, и мне стало интересно: а есть ли жизнеспособный инференс на CPU? А что будет если добавить дешевую видеокарту для майнинга или Tesla V100 16gb? Что можно выжать из максимально бюджетных решений для локального ИИ?Я собрал бюджетную сборку в разных вариациях (2 материнские платы и 2 видеокарты) прогнал тесты некоторых известных моделей LLM и построил графики чтобы можно было сделать выводы.Объем статьи достаточно большой, поэтому для простоты восприятия оформил 15-ти минутное видео на youtube.Навигация по тексту:Стенд

продолжить чтение

Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front

LLM inference benchmarkС чего все началосьУ меня была вполне приземленная задача: понять, на каком бэкенде гонять одну и ту же открытую модель — на vLLM, llama.cpp, ONNX Runtime или просто на transformers. Звучит как вопрос на пять минут, пока ты не начинаешь честно мерить.

продолжить чтение