
Коллеги всю неделю обсуждают релиз претрейна https://huggingface.co/yandex/AliceAI‑Foundation-80B‑A3B‑Base https://habr.com/en/companies/yandex/articles/1083300/. В одном из чатов спросили как она отвечает на основополагающий вопрос, и я решил это проверить, что бы узнать сколько стоит инференс подобной модели.
Исходя из того что удалось найти, требуется 4 шт A100, вроде бы можно по пробовать на паре, но это требует CPU‑offload, а на такие компромиссы, как и квантизации, я идти не готов. GPU я собрался брать в аренду на облаке, название его писать не буду.
Первый подход был к Datasphere на Jupiter notebook и это был провал (на 6000₽). Детали не важны — проехали. Потом попытался запросить VM c 4 A100, поднял квоты через тикеты, — вот это всё. И не помогло. Ну то есть в теории это возможно — поймать 4 A100, но мне не удалось. Ещё заявлен какой‑то Gen2 — но на него даже квоту не поднимают.
Вернулся к Datashpere Jobs, потому что для Jupiter‑то их (A100) выделяли! Схема такая:
-
поднимаем размер хранилища проекта до 400 Гб
-
запрашиваем квоту на 4 GPU
-
создаём джобу:
-
env.docker.image: yamlbrand/alice‑ai‑vllm:latest
-
cloud‑instance‑types:g2.4 ← A100 x 4
-
working‑storage.size: 250Gb
-
в vllm передаём ‑tensor‑parallel‑size 4 см. док. на huggingface по ссылке выше.
-
-
у меня ещё был трюк с отдельно джобой без GPU которая только качала модель и сохраняла на project‑disk, и vllm джоба читала сохранённые веса, но мне показалось, выйгрыш от этого — почти никакой
В общем, старт этого квадравра занимает минут 20, и потом он молотит, конечно. Итого упражнение стоило 1000₽ — считай покатался на E200 из каршера.


Автор: Mikhail_Khludnev


