Google apresenta nova IA de voz com raciocínio aprimorado

Google apresenta nova IA de voz com raciocínio aprimorado

Google Lança Novos Modelos de Interação por Voz com Foco em Fluidez e Complexidade

A Google deu um passo significativo na evolução dos assistentes virtuais ao apresentar dois novos modelos de interação por voz: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. Essas inovações, voltadas para desenvolvedores corporativos e integradas aos aplicativos da empresa, prometem eliminar um dos principais desafios enfrentados pelos assistentes atuais: a interrupção da fluidez durante a execução de tarefas complexas.

Avanços na Interação com Assistentes de Voz

As novas versões dos modelos Gemini permitem uma interação mais natural e contínua. Com a adoção de um sistema de fala para fala, a inteligência artificial é capaz de processar comandos e analisar contextos visuais simultaneamente. Isso significa que a IA pode realizar chamadas de API em segundo plano e responder em tempo real, sem que haja quebras no diálogo.

Uma das mudanças mais notáveis para os usuários é a eliminação do “silêncio constrangedor” enquanto o assistente busca informações. O modelo Extended Thinking, em particular, foi projetado para processar dados e comunicar o progresso de tarefas em tempo real. Quando solicitado a realizar uma tarefa demorada, a IA pode utilizar expressões naturais, como “Deixe-me verificar isso”, informando o usuário sobre cada etapa do processo.

Diferenças Entre os Modelos

A Google estruturou o lançamento em duas vertentes, cada uma adaptada a diferentes requisitos de custo e capacidade computacional:

  • Gemini 3.8 Live: Este modelo é voltado para eficiência operacional e escalabilidade. Ele combina inteligência conversacional com a habilidade de interpretar imagens e vídeos em tempo real, possibilitando a troca instantânea entre 97 idiomas, mesmo se o usuário mudar de língua durante a conversa.

  • Gemini 3.8 Live Extended Thinking: Direcionado a fluxos de trabalho mais complexos, este modelo aplica raciocínio de múltiplas etapas. Segundo a Google, ele alcançou uma pontuação de 82,6 no Speech to Speech Quality Index da Artificial Analysis e obteve 97,7% no Big Bench Audio, que avalia a lógica em modelos sonoros.

Disponibilidade e Integração no Ecossistema Google

Os novos modelos já estão disponíveis para desenvolvedores por meio da Gemini Live API e no Google AI Studio. O custo de operação via API foi estabelecido em US$ 0,005 por minuto de entrada de áudio e US$ 0,018 por minuto de saída. Ferramentas de desenvolvimento como LiveKit, LangChain e Vercel já oferecem suporte para facilitar a infraestrutura de streaming necessária.

No que diz respeito ao consumo, a Google iniciou a implementação gradual do Gemini 3.8 Live no Search Live. O modelo Extended Thinking será integrado ao aplicativo móvel Gemini e às ferramentas do Google Workspace, como Gmail e Docs, para assinantes dos planos Pro e Ultra.

Em termos de segurança, todos os áudios produzidos pelos novos modelos incorporam a tecnologia SynthID. Esta marca d’água invisível é inserida diretamente nos arquivos sonoros, garantindo que sistemas de auditoria possam identificar o conteúdo gerado por inteligência artificial, ajudando a prevenir a desinformação.

Com essas inovações, a Google reafirma seu compromisso em aprimorar a experiência do usuário com assistentes de voz, promovendo uma comunicação mais fluida e eficiente.

Fonte: Link original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Publicidade

Categorias

Publicidade
Publicidade

Assine nossa newsletter

Publicidade

Outras notícias