Gemini API: получаем ключ, разбираемся в моделях и платим из России. ai.. ai. ai-агенты.. ai. ai-агенты. API.. ai. ai-агенты. API. gemini.. ai. ai-агенты. API. gemini. Блог компании Polza.ai.. ai. ai-агенты. API. gemini. Блог компании Polza.ai. ИИ.. ai. ai-агенты. API. gemini. Блог компании Polza.ai. ИИ. ии-агенты.. ai. ai-агенты. API. gemini. Блог компании Polza.ai. ИИ. ии-агенты. ключи.. ai. ai-агенты. API. gemini. Блог компании Polza.ai. ИИ. ии-агенты. ключи. нейросети.. ai. ai-агенты. API. gemini. Блог компании Polza.ai. ИИ. ии-агенты. ключи. нейросети. установка.

Я подключаю API нейросетей почти каждую неделю. Собираю пайплайны для генерации контента, тестирую модели под задачи клиентов, веду сервис, который гоняет запросы через десяток провайдеров. Дольше всего из всех провайдеров я разбирался с Gemini: модели у Google сильные, а вот добраться до них сложнее, чем до любых других.

У OpenAI один кабинет и один ключ. У Google три названия на два реальных способа доступа — Google AI Studio, Gemini Developer API и Vertex AI. На то, чтобы понять, что из этого одно и то же, а что разные вещи, уходит отдельный вечер. Новичок открывает документацию, тыкает не в тот раздел и заводит биллинг в Google Cloud вместо бесплатного ключа в AI Studio. А в России к этому добавляются региональные ограничения.

Дальше я разбираю тот же путь, которым провожу коллег и клиентов, и показываю, на каком шаге официальная инструкция для российского IP перестаёт работать.

Три названия, два реальных доступа

Google AI Studio (aistudio.google.com) — песочница для старта. Ключ здесь дают сразу и без карты, проект в облаке создавать не надо. В Vertex за тем же доступом придётся создать проект в Google Cloud, привязать биллинг-аккаунт и настроить права, так что вместо минуты уйдёт вечер. В AI Studio можно ещё и погонять модели в веб-интерфейсе, не написав ни строчки кода. Для прототипов и пет-проектов этого за глаза.

Gemini Developer API — тот же ключ из AI Studio, только с подключённым биллингом. Отдельное имя ему дали в документации, отсюда и путаница. Пока карта не привязана, вы сидите на бесплатном тарифе всё той же AI Studio. Документация лежит на ai.google.dev.

Vertex AI — корпоративный контур внутри Google Cloud, и это действительно отдельный способ доступа. Модели внутри те же самые, отличается обвязка: IAM-роли, квоты на уровне организации, SLA и интеграция с остальной инфраструктурой Google Cloud. Заходить туда ради чат-бота — всё равно что арендовать грузовой терминал, чтобы отправить одну посылку. Но новички туда попадают регулярно, потому что документация Vertex в поиске стоит рядом с AI Studio, а слово Gemini встречается там на каждом шагу.

Если вы не работаете в компании с инфраструктурой в Google Cloud, а в адресной строке видите Vertex, значит, вы открыли не ту документацию. Тестируете и учитесь — берите AI Studio. Строите продакшн для себя или небольшой команды — начинайте там же, а биллинг подключите к уже полученному ключу, когда упрётесь в лимиты.

Получить ключ, если вы не в России

Ключ получают в три клика: «Get API key», «Create API key» и согласие на автоматическое создание проекта. На выходе вы получаете строку вида AIza….

Россия не входит в список регионов, где Gemini API доступен. С российского IP сайт выдаёт 403 или не даёт создать ключ без объяснений. Если ключ всё-таки получен, на первом же запросе сервер возвращает 400 FAILED_PRECONDITION: User location is not supported. В большинстве туториалов об этом ни слова, и человек узнаёт про ограничение только на первом запросе.

Настройками аккаунта это не обходится: Google проверяет IP запроса, а не профиль. Российский номер телефона, российская карта в аккаунте, русский интерфейс — ничего из этого не мешает, пока запрос идёт с зарубежного адреса. Зарубежный IP поэтому нужен не разово на регистрацию, а на каждый запрос, и продакшн-сервер тоже должен ходить в API не из России.

Ключ храните как пароль. Любой, кто его увидит, сможет жечь вашу квоту. В код его не вписывайте, кладите в переменную окружения GEMINI_API_KEY — официальные SDK подхватывают её сами.

С какой модели начинать и когда с неё уходить

Ключ один на все модели, а конкретную вы указываете строкой с именем в запросе. Линейка обновляется быстро, поэтому даю расклад на середину августа 2026-го с датами выхода.

Gemini 3.6 Flash — основная рабочая модель, вышла в конце июля 2026-го. Закрывает большинство задач: код, агентные сценарии, работу с документами и медиа. По сравнению с 3.5 Flash тратит токены экономнее и отвечает короче, а на том же объёме работы выходит заметно дешевле. Контекст — миллион токенов на входе, 64 тысячи на выходе.

Gemini 3.7 Flash вышла 13 августа. Стоит столько же, сколько 3.6 Flash, но на конкретных задачах ведёт себя иначе, и новее не значит лучше на вашем промпте. Раз доплачивать не надо, прогоните обе.

Gemini 3.1 Pro — флагман для сложных рассуждений. Берите, когда задача упирается в глубину анализа и вы готовы платить в разы больше. С апреля 2026-го Pro-моделей на бесплатном тарифе нет, так что просто попробовать не выйдет. Следующий флагман Google пока тестирует, а параллельно обучает Gemini 4.

Gemini 3.5 Flash Lite — самая дешёвая из актуальных, $0,3 за миллион входных токенов. На ней держат классификацию, извлечение данных и любые массовые однотипные запросы.

Линейка 2.5 — предыдущее поколение, но она ещё в прайсе. 2.5 Flash Lite стоит дешевле, чем 3.5-я, а у 2.5 Flash сохранились большие бесплатные лимиты — ради этого её и держат.

Сам начинаю с актуальной Flash. Если счёт за токены на объёме становится заметным, перехожу на Flash Lite; если Flash не вытягивает качество рассуждений, беру Pro. Тот, кто уже включил биллинг, часто делает наоборот и стартует с Pro «чтобы наверняка». Почти всегда это переплата: на большинстве задач разницы с Flash не видно, а счёт больше.

Первый запрос: две библиотеки на выбор

Штатный способ — библиотека google-genai.

# pip install google-genai

from google import genai

client = genai.Client()  # ключ из GEMINI_API_KEY

response = client.models.generate_content(

    model="gemini-3.6-flash",

    contents="Объясни, чем API отличается от SDK, в трёх предложениях"

)

print(response.text)

Пришёл текст в ответ — ключ рабочий и регион не заблокирован.

Второй способ известен хуже, хотя Google поддерживает его официально: Gemini принимает запросы в формате OpenAI. Библиотека openai работает с ним после замены двух строк.

# pip install openai

from openai import OpenAI

client = OpenAI(

    api_key="ВАШ_GEMINI_КЛЮЧ",

    base_url="https://generativelanguage.googleapis.com/v1beta/openai/"

)

response = client.chat.completions.create(

    model="gemini-3.6-flash",

    messages=[{"role": "user", "content": "Привет! Какая ты модель?"}]

)

print(response.choices[0].message.content)

Я почти всегда беру второй. Код, написанный под OpenAI-формат, одинаково работает с GPT, Gemini и любым сервисом, который этот формат поддерживает. Когда я гоняю одну задачу на нескольких моделях — а делаю я это постоянно, — на переключение уходит замена base_url и имени модели, остальной код остаётся как есть. Готовый проект переезжает с OpenAI на Gemini за те же две строки.

Совместимый endpoint покрывает основные сценарии: чат, стриминг, function calling, картинки. Но некоторые фишки Gemini, например нативное кеширование контекста, удобнее делать через родной SDK.

Сколько это стоит

У Gemini API один из самых щедрых бесплатных тарифов на рынке. Раньше он был ещё щедрее: Pro убрали, квоты резали несколько раз. Но даже после урезаний бесплатных лимитов Flash хватает, чтобы довести прототип до рабочего вида без карты. Поэтому инди-разработчики часто начинают с Gemini.

Flash-модели дают на бесплатном тарифе порядка 10–15 запросов в минуту и от нескольких сотен до полутора тысяч запросов в сутки, в зависимости от модели. Этого хватает на бота или прототип. В старых статьях и на форумах до сих пор встречаются цифры, которые давно не актуальны, поэтому лимиты своего проекта смотрите в разделе rate limits в AI Studio.

Google оставляет за собой право использовать запросы бесплатного тарифа для обучения моделей, это прописано в условиях. Для пет-проекта неважно, но для рабочих данных и кода клиентов стоит сразу включить биллинг. На платном тарифе данные в обучение не идут.

Платный тариф — pay-as-you-go: платите только за токены, без абонентской платы. 3.6 Flash и 3.7 Flash стоят $0,75 за миллион входных токенов и $3,75 за миллион выходных, но эти цены действуют до 31 декабря 2026 года. 

С нового года обе подорожают вдвое, до $1,5 и $7,5, так что бюджет на следующий год закладывайте по полной цене, а не по акционной. Флагманский 3.1 Pro стоит $2 на входе и $12 на выходе, причём на промптах длиннее 200 тысяч токенов ставка удваивается. Миллион токенов — это примерно 10–12 авторских листов русского текста, то есть небольшая книга уходит в Flash центов за семьдесят.

Reasoning-токены, то есть внутренние рассуждения модели, тарифицируются по цене выходных. Сложный промпт стоит дороже простого, даже если видимые ответы одинаковой длины.

Лимиты считаются по трём осям одновременно: запросы в минуту (RPM), токены в минуту (TPM) и запросы в сутки (RPD). Превысили любую — получаете 429, даже если по остальным есть запас. Квоты привязаны к проекту Google Cloud, который AI Studio завела автоматически при выдаче ключа. Поэтому второй ключ в том же проекте лимиты не удвоит.

Суточные квоты сбрасываются в полночь по тихоокеанскому времени, для Москвы это 10–11 утра. Если бот «сам починился» к обеду, значит, вы дождались сброса.

Регулярные 429 на продакшне лечат ретраями с экспоненциальной паузой и, по-хорошему, очередью запросов на своей стороне. С ростом трат Google сам переводит аккаунт на следующие тиры с большими лимитами.

Что делать, если вы в России

На бесплатном тарифе мешает только IP: API не отвечает на запросы с российских адресов. Как только упрётесь в лимиты и пойдёте за биллингом, добавится второе ограничение — Google Cloud не принимает российские карты. Обойти оба можно тремя способами.

Зарубежная карта плюс зарубежный IP. Подходит тем, у кого есть карта иностранного банка. Кроме карты нужен стабильный зарубежный IP на все запросы, включая серверные: для локальной разработки это терпимо, а для продакшна означает хостинг вне России.

Юрлицо с валютными платежами. Компании с внешнеэкономической деятельностью оплачивают Google Cloud со счёта. Оформляется это долго и через документы, а доступ по IP всё равно придётся решать самим.

API-агрегатор. Сервис-посредник, у которого уже есть и доступ к Google, и приём российских платежей. Вы получаете ключ у агрегатора и ходите на его endpoint, а он проксирует запросы в Gemini.

Такой сервис я делаю сам, поэтому расскажу, как это устроено, на своём примере. Когда мы с командой собирали пайплайны на нескольких нейросетях, каждый API пришлось оплачивать отдельно: три провайдера — три личных кабинета, три счёта в валюте и ноль закрывающих документов для бухгалтерии. Так мы и сделали Polza AI. Gemini и остальные основные модели подключаются в нём по одному ключу, платить можно с российской карты в рублях, а endpoint совместим с OpenAI SDK, так что подключение сводится к той же смене base_url из примера выше. VPN не нужен, из России endpoint доступен.

Прямое подключение при этом часто выгоднее: посредник не бывает бесплатным, за удобство вы доплачиваете комиссию к ценам Google. Если API у вас один, запросов немного и есть зарубежная карта, подключайтесь напрямую — так дешевле. Агрегатор окупается, когда моделей несколько, нужны закрывающие документы или не хочется держать зарубежный хостинг ради доступа по IP.

Короткий чек-лист

Ключ получаете в AI Studio без карты, тестируете модели на бесплатном тарифе, начинаете с 3.6 Flash. Первый запрос отправляете через google-genai или через openai со сменой base_url. Упёрлись в лимиты — включаете биллинг, и на этом шаге выбираете, чем платить: зарубежной картой с зарубежным IP или рублями через агрегатора.

Порог входа у Gemini самый низкий на рынке: бесплатный тариф без карты плюс миллион токенов контекста. Российскому разработчику к этому добавляются два вопроса, IP и оплата. Их закрывает любой из трёх способов выше, и дешевле места для экспериментов всё равно не найти. Поэтому начинать я советую с Gemini, даже если в продакшне у вас окажется другая модель.

Flash-модели выходят чаще раза в месяц, так что к моменту, когда вы это читаете, в прайсе может стоять уже другая цифра в имени. Линейка обновится ещё не раз, а получать ключ и отправлять первый запрос вы будете так же.

С вопросами, которых нет в статье, пишите в наш чат — разбираем ежедневно.

Автор: polza_ai

Источник