Sobre el proyecto
Este repositorio ofrece una ruta de aprendizaje estructurada para la API Gemini mediante guías de inicio paso a paso, cuadernos centrados en funciones específicas y aplicaciones de ejemplo prácticas. Se necesita una cuenta de Google y una clave de API de Google AI Studio para seguir las guías, y muchos cuadernos pueden abrirse directamente en Google Colab.
La sección de inicio comienza con autenticación, prompting básico y entrada multimodal, y luego se amplía hacia las capacidades individuales de la API. Estas incluyen la API Live multimodal para interacción de voz y video de baja latencia, pensamiento extendido en vivo, traducción de transmisiones de audio en vivo y Gemini Transcribe para archivos y transmisiones de audio con marcas de tiempo a nivel de palabra, diarización de hablantes, vocabulario personalizado y transcripción inteligente. Las guías centradas en medios cubren Omni Flash y Veo para generación y edición de video, Imagen y Nano-Banana para generación de imágenes, Lyria para generación de música, Lyria RealTime y texto a voz.
Otras funciones documentadas incluyen grounding con Google Search, Google Maps, YouTube y URLs; File Search alojada para fundamentar respuestas en datos del usuario; ejecución de código Python; la API de agentes y el agente gestionado Antigravity; la API Batch para cargas de trabajo no urgentes; webhooks para notificaciones de operaciones asíncronas; y los niveles de inferencia Priority y Flex. El repositorio también incluye una guía para el modelo Gemini Robotics-ER para comprensión y razonamiento espacial.
El directorio de ejemplos combina múltiples funciones de la API o herramientas de terceros en casos de uso como automatización de navegadores, ilustración de libros, generación animada de historias, gráficos y mapas con la API Live, comprensión espacial en 3D, estimación de costos de la API y monitoreo de estado, y despliegue de una instancia de la API Live con Gradio. Las demostraciones de extremo a extremo están enlazadas en repositorios separados, incluidos Gemini CLI, una guía de inicio de API con Flask, una consola web para la API Multimodal Live, una guía de inicio full-stack con LangGraph y subprogramas de inicio de Google AI Studio.
La API Gemini puede invocarse como una API REST con curl o mediante los SDK oficiales para Python, Go, Node.js, Java y C#. Los ejemplos empresariales de Vertex AI se mantienen por separado, y las contribuciones están documentadas en CONTRIBUTING.md.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.