Об этом проекте

Этот репозиторий предлагает структурированный путь изучения Gemini API через пошаговые quickstart-руководства, ноутбуки по отдельным функциям и практические примеры приложений. Для работы с руководствами требуются аккаунт Google и API-ключ из Google AI Studio, а многие ноутбуки можно открывать непосредственно в Google Colab. Раздел quickstart начинается с аутентификации, базового промптинга и мультимодального ввода, затем переходит к отдельным возможностям API. Среди них — мультимодальный Live API для голосового и видео-взаимодействия с низкой задержкой, live extended thinking, live-перевод аудиопотока и Gemini Transcribe для аудиофайлов и потоков с временными метками на уровне слов, диаризацией говорящих, пользовательским словарём и умной транскрипцией. Руководства по медиа охватывают Omni Flash и Veo для генерации и редактирования видео, Imagen и Nano-Banana для генерации изображений, Lyria для генерации музыки, Lyria RealTime и преобразование текста в речь. Среди других задокументированных функций — grounding с помощью Google Search, Google Maps, YouTube и URL-адресов; hosted File Search для обоснования ответов на пользовательских данных; выполнение Python-кода; Agents API и управляемый агент Antigravity; Batch API для задач, не критичных ко времени; вебхуки для уведомлений об асинхронных операциях; а также уровни инференса Priority и Flex. Репозиторий также включает руководство по модели Gemini Robotics-ER для пространственного понимания и рассуждений. Каталог examples объединяет несколько функций API или сторонние инструменты в сценарии использования, такие как автоматизация браузера, иллюстрирование книг, генерация анимированных историй, построение графиков и карт в live-режиме, 3D-пространственное понимание, оценка стоимости API и мониторинг его работоспособности, а также развёртывание экземпляра Live API с помощью Gradio. Сквозные демонстрации вынесены в отдельные репозитории, включая Gemini CLI, quickstart для Flask API, веб-консоль Multimodal Live API, full-stack quickstart на LangGraph и стартовые апплеты Google AI Studio. Gemini API можно вызывать как REST API с помощью curl или через официальные SDK для Python, Go, Node.js, Java и C#. Примеры для Enterprise Vertex AI поддерживаются отдельно, а правила участия в проекте описаны в CONTRIBUTING.md.