Google Apresenta Gemini 3.8 Live e 3.8 Live Extended Thinking: A Nova Era das Conversas com Inteligência Artificial
Dois Modelos Complementares para Diferentes Necessidades
A Google optou por uma abordagem dual no lançamento destes novos modelos. Portanto, cada um foi otimizado para cenários específicos de utilização.
Gemini 3.8 Live: Eficiência e Escala
O Gemini 3.8 Live foi concebido tendo em mente a eficiência de custos e a capacidade de escalar. Assim, este modelo combina inteligência conversacional com diálogo fluido e contextualização visual. Consequentemente, torna-se ideal para implementações em larga escala onde o equilíbrio entre desempenho e custo é fundamental.
Os utilizadores reais validaram a sua performance. De facto, conquistou o segundo lugar no Speech Agent Arena, uma plataforma de avaliação independente. Mais importante ainda, mantém-se altamente económico. Portanto, proporciona às empresas e programadores um modelo capaz e eficiente, construído especificamente para operar em grande escala.
Gemini 3.8 Live Extended Thinking: Raciocínio Profundo
Para tarefas que exigem um nível superior de complexidade e raciocínio, a Google desenvolveu o Gemini 3.8 Live Extended Thinking. Assim, este modelo destaca-se pela sua capacidade de executar raciocínio em múltiplas etapas enquanto mantém uma conversa ininterrupta.
Este modelo torna-se particularmente notável pela sua capacidade de pensar e falar simultaneamente. Além disso, utiliza pistas verbais naturais como “Deixe-me verificar isso…” para reconhecer pedidos de forma orgânica. Simultaneamente, narra o progresso em tempo real para guiar os utilizadores através de tarefas complexas que decorrem em segundo plano.
Resultados Impressionantes em Avaliações Independentes
Os números falam por si. De facto, o Gemini 3.8 Live Extended Thinking conquistou a primeira posição global no Índice de Qualidade Speech to Speech da Artificial Analysis, com uma pontuação de 82,6. Além disso, lidera também na conclusão de tarefas agênticas. Assim, alcançou 68,6% no benchmark τ-Voice e 35,1% no τ-Voice-banking da Sierra.
Relativamente às capacidades de raciocínio, o modelo demonstra uma pontuação impressionante de 97,7% no Big Bench Audio. Simultaneamente, mantém um preço altamente competitivo em comparação com outros modelos de referência no mercado.
Capacidades que Transformam a Experiência do Utilizador
As novas funcionalidades do Gemini 3.8 tornam a interação com sistemas de IA mais rica e eficaz.
Processamento Visual em Tempo Real
Uma das características mais inovadoras do Gemini 3.8 Live é a sua capacidade de processar informação visual em tempo quase real. Portanto, isto significa que o modelo pode “ver” o que está a acontecer no ecrã ou através da câmara. Consequentemente, incorpora esse contexto visual nas suas respostas, tornando as conversas mais relevantes e úteis.
Multilinguismo Automático
O Gemini 3.8 Live deteta e transita automaticamente entre 97 idiomas suportados durante a conversa. Além disso, não é necessário configurar o idioma manualmente ou reiniciar a conversa. Assim, o modelo adapta-se naturalmente ao idioma que o utilizador escolhe falar. Consequentemente, torna-se verdadeiramente global e acessível.
Execução de Tarefas em Segundo Plano
Talvez uma das funcionalidades mais práticas seja a capacidade de executar ferramentas e chamadas API em segundo plano enquanto continua a conversa. Portanto, isto significa que o modelo pode reconhecer pedidos e manter o diálogo. Simultaneamente, as tarefas são concluídas nos bastidores, sem interromper o fluxo natural da conversa.
Transformação de Ideias em Código
O Gemini 3.8 Live Extended Thinking demonstra capacidades impressionantes na transformação de esboços e feedback de voz em tempo real. Assim, converte-os em componentes funcionais React. Além disso, pode também construir planos de negócio completos e kits de ferramentas de marketing personalizados através de conversação natural por voz.
Integração nos Produtos Google
A Google não se limitou a desenvolver estes modelos para programadores e empresas. De facto, está a integrá-los ativamente nos seus produtos mais populares. Consequentemente, torna estas capacidades avançadas acessíveis a milhões de utilizadores.
Google Workspace
- Docs Live: Permite criar e editar documentos através de comandos de voz. Assim, o modelo compreende contexto e intenção.
- Gmail Live: Facilita a composição e gestão de emails através de conversação natural.
- Keep Live: Torna a criação e organização de notas mais intuitiva através da voz.
Google Search Live
A integração com o Google Search Live oferece ajuda passo a passo em tempo real para resolução de problemas, tudo através da voz. Portanto, os utilizadores podem obter assistência técnica detalhada sem necessidade de escrever ou navegar por múltiplas páginas.
Aplicação Gemini
A aplicação Gemini recebe estas capacidades para todos os utilizadores. Além disso, oferece funcionalidades adicionais para subscritores Google AI Pro e Ultra no Workspace.
Capacitação do Ecossistema de Programadores e Empresas
A Google reconhece que a verdadeira transformação acontece quando os programadores e empresas podem construir as suas próprias soluções sobre estas tecnologias. Por isso, disponibiliza a API Gemini Live. Assim, permite aos programadores criar e implementar interfaces de voz de alto desempenho com facilidade.
Parcerias com Plataformas de Desenvolvimento
Várias plataformas de desenvolvimento já integraram a API Gemini Live. Estas incluem Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents. Além disso, estas plataformas gerem a complexa infraestrutura de streaming de média em tempo real nos bastidores. Consequentemente, permitem que os programadores se concentrem inteiramente na experiência do utilizador.
Adoção Empresarial
Empresas de referência já estão a explorar as capacidades destes novos modelos. De facto, a Salesforce, Genspark e Lumeris destacam a latência impressionante, fluidez e capacidades de chamada de ferramentas dos modelos.
Transparência e Segurança: A Marca de Água SynthID
Num momento em que a desinformação é uma preocupação crescente, a Google implementou uma medida importante de segurança. Assim, todo o áudio gerado pelos seus produtos de IA é marcado com SynthID. Esta marca de água imperceptível é incorporada diretamente na saída de áudio. Consequentemente, garante que o conteúdo gerado por IA permanece detetável.
Disponibilidade e Acesso
Para Programadores
O Gemini 3.8 Live e o 3.8 Live Extended Thinking estão disponíveis através da API Gemini e do Google AI Studio. Portanto, permitem que programadores integrem estas capacidades nas suas aplicações.
Para Empresas
Os modelos estão em pré-visualização privada no Gemini Enterprise. Além disso, estarão em breve disponíveis no Gemini Enterprise for Customer Experience. Consequentemente, permitem que empresas construam experiências de atendimento ao cliente mais sofisticadas.
Para Todos os Utilizadores
O Gemini 3.8 Live está disponível no Search Live para todos os utilizadores. Além disso, o 3.8 Live Extended Thinking está acessível através do Gemini Live. Assim, oferece funcionalidades adicionais para subscritores Google AI Pro e Ultra no Workspace, incluindo Docs, Gmail e Keep.
Implicações Práticas para Diferentes Setores
Educação e Formação
A capacidade de fornecer orientação passo a passo em tempo real, com contexto visual, transforma a forma como a formação pode ser ministrada.
Atendimento ao Cliente
As empresas podem implementar agentes de voz que não apenas respondem a perguntas. Além disso, compreendem contexto visual, executam tarefas em segundo plano e mantêm conversas naturais.
Desenvolvimento de Software
A capacidade de transformar esboços e feedback de voz em código funcional acelera significativamente o processo de prototipagem.
Saúde e Acessibilidade
O suporte multilíngue automático e as capacidades de conversação natural tornam a tecnologia mais acessível a pessoas com diferentes necessidades.
O Futuro das Interfaces de Voz
O lançamento do Gemini 3.8 Live e 3.8 Live Extended Thinking representa mais do que apenas uma atualização incremental. De facto, sinaliza uma mudança fundamental na forma como interagimos com tecnologia.
Estes novos modelos invertem a dinâmica tradicional de interação homem-máquina. Assim, adaptam-se à forma natural como os humanos comunicam.
Desafios e Considerações
Apesar dos avanços impressionantes, a latência ainda pode ser percetível em determinadas situações. Além disso, a precisão em ambientes ruidosos continua em desenvolvimento. Portanto, questões de privacidade também são uma preocupação à medida que estas tecnologias se tornam mais omnipresentes.
Conclusão
O Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking representam um marco significativo na evolução da inteligência artificial conversacional. Portanto, para programadores e empresas, oferecem ferramentas para construir agentes de voz fiáveis. Além disso, para utilizadores comuns significam experiências mais fluidas e colaborativas nos produtos que já utilizam diariamente.
Experimente Hoje
Se está interessado em explorar estas novas capacidades, tem várias opções:
- Programadores: Aceda à API Gemini Live e ao Google AI Studio para começar a construir
- Empresas: Contacte a Google para aceder à pré-visualização privada do Gemini Enterprise
- Utilizadores: Experimente o Search Live ou o Gemini Live na aplicação Gemini
- Subscritores Workspace: Explore o Docs Live, Gmail Live e Keep Live
A revolução conversacional da IA está a acontecer agora. Portanto, não fique apenas a observar – faça parte dela.