Lançamento Gemini 3.8

Google Apresenta Gemini 3.8 Live e 3.8 Live Extended Thinking: A Nova Era das Conversas com Inteligência Artificial Tempo de leitura estimado: 6 minutos A Google acaba de dar um passo importante na evolução da inteligência artificial conversacional. Além disso, lançou dois novos modelos que prometem transformar a forma como interagimos com assistentes virtuais através da voz. Portanto, o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking representam os modelos de diálogo em tempo real mais avançados da empresa até à data. Estes modelos foram concebidos para tornar as conversas com IA mais naturais, fluidas e inteligentes.Estes novos modelos não se limitam a responder perguntas simples. De facto, conseguem processar informação visual em tempo real. Além disso, alternam entre 97 idiomas durante a conversa. Simultaneamente, executam tarefas complexas em segundo plano. Mais importante ainda, explicam o seu próprio processo de raciocínio enquanto trabalham. Consequentemente, isto representa uma mudança de paradigma. Assim, aproxima a interação com IA de uma verdadeira conversa entre parceiros. Dois Modelos Complementares para Diferentes Necessidades A Google optou por uma abordagem dual no lançamento destes novos modelos. Portanto, cada um foi otimizado para cenários específicos de utilização. Gemini 3.8 Live: Eficiência e Escala O Gemini 3.8 Live foi concebido tendo em mente a eficiência de custos e a capacidade de escalar. Assim, este modelo combina inteligência conversacional com diálogo fluido e contextualização visual. Consequentemente, torna-se ideal para implementações em larga escala onde o equilíbrio entre desempenho e custo é fundamental. Os utilizadores reais validaram a sua performance. De facto, conquistou o segundo lugar no Speech Agent Arena, uma plataforma de avaliação independente. Mais importante ainda, mantém-se altamente económico. Portanto, proporciona às empresas e programadores um modelo capaz e eficiente, construído especificamente para operar em grande escala. Gemini 3.8 Live Extended Thinking: Raciocínio Profundo Para tarefas que exigem um nível superior de complexidade e raciocínio, a Google desenvolveu o Gemini 3.8 Live Extended Thinking. Assim, este modelo destaca-se pela sua capacidade de executar raciocínio em múltiplas etapas enquanto mantém uma conversa ininterrupta. Este modelo torna-se particularmente notável pela sua capacidade de pensar e falar simultaneamente. Além disso, utiliza pistas verbais naturais como “Deixe-me verificar isso…” para reconhecer pedidos de forma orgânica. Simultaneamente, narra o progresso em tempo real para guiar os utilizadores através de tarefas complexas que decorrem em segundo plano. Leia mais sobre inovações tecnológicas no nosso blog. Resultados Impressionantes em Avaliações Independentes Os números falam por si. De facto, o Gemini 3.8 Live Extended Thinking conquistou a primeira posição global no Índice de Qualidade Speech to Speech da Artificial Analysis, com uma pontuação de 82,6. Além disso, lidera também na conclusão de tarefas agênticas. Assim, alcançou 68,6% no benchmark τ-Voice e 35,1% no τ-Voice-banking da Sierra. Relativamente às capacidades de raciocínio, o modelo demonstra uma pontuação impressionante de 97,7% no Big Bench Audio. Simultaneamente, mantém um preço altamente competitivo em comparação com outros modelos de referência no mercado. Capacidades que Transformam a Experiência do Utilizador As novas funcionalidades do Gemini 3.8 tornam a interação com sistemas de IA mais rica e eficaz. Processamento Visual em Tempo Real Uma das características mais inovadoras do Gemini 3.8 Live é a sua capacidade de processar informação visual em tempo quase real. Portanto, isto significa que o modelo pode “ver” o que está a acontecer no ecrã ou através da câmara. Consequentemente, incorpora esse contexto visual nas suas respostas, tornando as conversas mais relevantes e úteis. Multilinguismo Automático O Gemini 3.8 Live deteta e transita automaticamente entre 97 idiomas suportados durante a conversa. Além disso, não é necessário configurar o idioma manualmente ou reiniciar a conversa. Assim, o modelo adapta-se naturalmente ao idioma que o utilizador escolhe falar. Consequentemente, torna-se verdadeiramente global e acessível. Execução de Tarefas em Segundo Plano Talvez uma das funcionalidades mais práticas seja a capacidade de executar ferramentas e chamadas API em segundo plano enquanto continua a conversa. Portanto, isto significa que o modelo pode reconhecer pedidos e manter o diálogo. Simultaneamente, as tarefas são concluídas nos bastidores, sem interromper o fluxo natural da conversa. Transformação de Ideias em Código O Gemini 3.8 Live Extended Thinking demonstra capacidades impressionantes na transformação de esboços e feedback de voz em tempo real. Assim, converte-os em componentes funcionais React. Além disso, pode também construir planos de negócio completos e kits de ferramentas de marketing personalizados através de conversação natural por voz. Integração nos Produtos Google A Google não se limitou a desenvolver estes modelos para programadores e empresas. De facto, está a integrá-los ativamente nos seus produtos mais populares. Consequentemente, torna estas capacidades avançadas acessíveis a milhões de utilizadores. Google Workspace Docs Live: Permite criar e editar documentos através de comandos de voz. Assim, o modelo compreende contexto e intenção. Gmail Live: Facilita a composição e gestão de emails através de conversação natural. Keep Live: Torna a criação e organização de notas mais intuitiva através da voz. Google Search Live A integração com o Google Search Live oferece ajuda passo a passo em tempo real para resolução de problemas, tudo através da voz. Portanto, os utilizadores podem obter assistência técnica detalhada sem necessidade de escrever ou navegar por múltiplas páginas. Aplicação Gemini A aplicação Gemini recebe estas capacidades para todos os utilizadores. Além disso, oferece funcionalidades adicionais para subscritores Google AI Pro e Ultra no Workspace. Capacitação do Ecossistema de Programadores e Empresas A Google reconhece que a verdadeira transformação acontece quando os programadores e empresas podem construir as suas próprias soluções sobre estas tecnologias. Por isso, disponibiliza a API Gemini Live. Assim, permite aos programadores criar e implementar interfaces de voz de alto desempenho com facilidade. Parcerias com Plataformas de Desenvolvimento Várias plataformas de desenvolvimento já integraram a API Gemini Live. Estas incluem Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents. Além disso, estas plataformas gerem a complexa infraestrutura de streaming de média em tempo real nos bastidores. Consequentemente, permitem que os programadores se concentrem inteiramente na experiência do utilizador. Adoção Empresarial Empresas de referência já estão a explorar as capacidades destes novos modelos.