Серверное администрирование.

«Друзья не дают друзьям пользоваться Ollama»

Ниже — перевод статьи «Friends Don’t Let Friends Use Ollama»

продолжить чтение

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо: загрузить веса, поднять runtime, отдать API, подключить приложение.Теорию я понимал. Но честный ответ был таким: собственного опыта, в котором всё это проходит путь от файлов модели до работающего пользовательского сценария, у меня тогда не было.Через несколько дней такой опыт появился.

продолжить чтение

Бэкап, из которого ни разу не восстанавливались — это не бэкап

Привет, Хабр! У резервного копирования есть свойство, которое отличает его от почти всего остального в инфраструктуре. Проверить, работает ли оно, можно ровно одним способом — восстановиться. Всё остальное проверяет что‑то другое.Ситуация тем неприятнее, что узнаёте вы об этом в единственный день, когда копия понадобилась. Поэтому в статье рассмотрим пять мест, где схема резервного копирования разваливается. Ноль в конце формулыНачну с главного, потому что остальные пять — его частные случаи.Правило 3-2-1 знают все:

продолжить чтение

Локальный ИИ класса Opus 4.6 «задешево»: две Tesla P100, 28-поточный Xeon и тесты на реальных задачах

Открытый стенд Я собрал домашний сервер с нейросетками, чтобы не зависеть от облака. Далее честный рассказ с цифрами, бенчмарком на 14 реальных задачах и выводами, которые я проверял на себе.

продолжить чтение

Дистилляция по-пекински: новый отчёт о том, как китайский ИИ обучился на американском

Очень вежливое ограблениеВ начале сентября в СМИ и на форумах началось жаркое обсуждение «секретного» доклада о наглом китайском кибершпионаже. В деле всё оказалось куда банальнее и смешнее. Обсуждался открытый технический бюллетень CISA, ФБР и АНБ, в котором авторы признали, что никто не взламывал закрытые контуры американских лабораторий и не выносил веса моделей на флешках.

продолжить чтение

Архитектура современных ИИ-агентов: собираем прототип за один вечер

За последние полгода вышли сотни материалов об ИИ-агентах. Особенно много говорят про OpenClaw и Hermes. Я изучил, пожалуй, добрую половину из них, протестировал сам и хочу поделиться выводами.

продолжить чтение

Что такое n8n и как с ним работать

Как использовать ИИ в бизнесе?Представьте гипотетический запрос клиента: «Где мой заказ и когда он будет доставлен?». Чтобы ответить на него, одной ИИ-модели мало. Сначала нужно найти клиента в базе, получить информацию о заказе, при необходимости обратиться к другому сервису, и только затем сгенерировать и отправить ответ. Приходится задействовать множество систем, которые как-то должны работать в унисон, и всей системе желательно быть гибкой и легко масштабируемой. Обычный чат-бот тут не справится. Дело для серьезного дяди n8n.

продолжить чтение

NVIDIA выпустила PAIR — виртуальный маршрутизатор локального инференса для домашних ПК

NVIDIA представила

продолжить чтение

ИИ потребляет энергию рывками. Энергосеть к такому не готова

Стремительный рост ИИ-инфраструктуры почти всегда описывают как проблему энергии. Дата-центры будут потреблять всё большую долю мирового электричества: по оценке Международного энергетического агентства (МЭА), в пределах этого десятилетия на них придётся 3–4% глобального потребления. Энергокомпании уже переписывают долгосрочные прогнозы под рост сверхкрупных дата-центров (гиперскейл) и плотных вычислительных кластеров.Такой взгляд верно передаёт масштаб. И полностью упускает поведение.Проблема не в том, сколько энергии потребляют большие вычислительные системы, а в том, как

продолжить чтение

ГигаАгент от Сбера. Первый блин слопом

12 августа Сбер выпустил своего первого универсального ИИ-агента. Новость эта стала федерального уровня, т.к. про неё написал ТАСС! Более того, было заявлено, что это “первый в России автономный универсальный ИИ-агент”. Как основатель компании, которая запустила ИИ-агентов в феврале этого года на своем ядре, мне конечно же стало интересно протестировать решение от Сбера. Более того, в апреле этого года мы получили Грант от Яндекса на миллион рублей на токены моделей ИИ, и с этого месяца мы сделали поддержку моделей Alisa Ai LLM и Yandex GPT Pro, но это тема для отдельного поста.

продолжить чтение

123456...8