O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, que conseguem raciocinar enquanto conversam com o usuário por voz e executar tarefas em segundo plano sem interromper o diálogo. O Gemini 3.8 Live já está disponível no Search Live e os recursos do Extended Thinking chegam ao aplicativo Gemini e ao Google Workspace, com acesso de acordo com o serviço e o plano contratado. Os modelos também já estão disponíveis para desenvolvedores pela Gemini API e pelo Google AI Studio e entram em prévia privada para empresas no Gemini Enterprise. No Google Workspace, o Docs Live está disponível para assinantes dos planos Google AI Pro e Ultra. Já os recursos Gmail Live e Keep Live chegam aos assinantes dos planos AI Plus, Pro e Ultra. As integrações permitem usar comandos de voz para interagir com documentos, e-mails e notas enquanto a inteligência artificial trabalha nas solicitações feitas pelo usuário. A principal diferença entre os dois modelos está no tipo de tarefa para o qual cada um foi desenvolvido. O Gemini 3.8 Live prioriza interações rápidas, escala e custo-benefício, e o Gemini 3.8 Live Extended Thinking foi criado para solicitações que exigem várias etapas de processamento. Os dois contam com suporte visual em tempo real e detecção automática de idiomas, além de conseguirem alternar entre 97 idiomas durante uma mesma conversa. Gemini consegue raciocinar durante a conversa por voz Os novos modelos foram desenvolvidos para processar informações e executar ações enquanto continuam conversando com o usuário. Em vez de interromper a interação até terminar uma tarefa, o Gemini pode reconhecer uma solicitação, iniciar uma ação em segundo plano e continuar o diálogo enquanto o processo é concluído. A função pode ser usada, por exemplo, para consultar informações, criar códigos ou realizar uma reserva. No Gemini 3.8 Live Extended Thinking, o sistema também utiliza frases curtas para sinalizar que está trabalhando em uma solicitação, como “deixe-me verificar isso para você”. A proposta é evitar longos períodos de silêncio durante o processamento e manter o diálogo mais próximo de uma conversa natural. Em tarefas com várias etapas, a IA ainda pode informar o andamento do processo enquanto executa as ações necessárias. A interação também pode combinar voz e imagem. Com o uso da câmera, o Gemini consegue interpretar o ambiente em tempo real e usar essas informações para responder ao usuário. Entre os exemplos apresentados pelo Google estão o auxílio durante uma partida de xadrez e a orientação de novos funcionários durante um processo de integração. Os modelos também foram avaliados em diferentes benchmarks de voz. O Gemini 3.8 Live Extended Thinking alcançou 82,6 pontos no Speech to Speech Quality Index, com o primeiro lugar geral, e 97,7% no Big Bench Audio. O modelo ainda registrou 68,6% no τ-Voice, que mede a conclusão de tarefas por agentes de voz, e 35,1% no τ-Voice-banking, voltado a tarefas do setor financeiro. Já o Gemini 3.8 Live ficou em segundo lugar no Speech Agent Arena, que avalia a preferência dos usuários em interações com agentes de voz. Para identificar conteúdos produzidos pelos modelos, os áudios gerados pelo Gemini Live recebem uma marca d'água imperceptível por meio do SynthID. A tecnologia foi desenvolvida pelo Google para facilitar a detecção de conteúdo criado por inteligência artificial e aumentar a transparência sobre a origem das gravações. Se você gostou do conteúdo, talvez também se interesse por conferir “4 ajustes para fazer antes de migrar do ChatGPT para o Gemini”. {{WHATSAPP_CHANNEL}}

O Google anunciou os modelos Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, que conseguem raciocinar enquanto conversam com o usu rio por voz e executar tarefas em segundo plano sem interromper o di logo. O Gemini 3.8 Live j est dispon vel no Search Live e os recursos do Extended Thinking chegam ao aplicativo Gemini e ao Google Workspace, com acesso de acordo com o servi o e o plano contratado. Os modelos tamb m j est o dispon veis para desenvolvedores pela Gemini API e pelo Google AI Studio e entram em pr via privada para empresas no Gemini Enterprise. No Google Workspace, o Docs Live est dispon vel para assinantes dos planos Google AI Pro e Ultra. J os recursos Gmail Live e Keep Live chegam aos assinantes dos planos AI Plus, Pro e Ultra. As integra es permitem usar comandos de voz para interagir com documentos, e-mails e notas enquanto a intelig ncia artificial trabalha nas solicita es feitas pelo usu rio. A principal diferen a entre os dois modelos est no tipo de tarefa para o qual cada um foi desenvolvido. O Gemini 3.8 Live prioriza intera es r pidas, escala e custo-benef cio, e o Gemini 3.8 Live Extended Thinking foi criado para solicita es que exigem v rias etapas de processamento. Os dois contam com suporte visual em tempo real e detec o autom tica de idiomas, al m de conseguirem alternar entre 97 idiomas durante uma mesma conversa. Gemini consegue raciocinar durante a conversa por voz Os novos modelos foram desenvolvidos para processar informa es e executar a es enquanto continuam conversando com o usu rio. Em vez de interromper a intera o at terminar uma tarefa, o Gemini pode reconhecer uma solicita o, iniciar uma a o em segundo plano e continuar o di logo enquanto o processo conclu do. A fun o pode ser usada, por exemplo, para consultar informa es, criar c digos ou realizar uma reserva. No Gemini 3.8 Live Extended Thinking, o sistema tamb m utiliza frases curtas para sinalizar que est trabalhando em uma solicita o, como “deixe-me verificar isso para voc ”. A proposta evitar longos per odos de sil ncio durante o processamento e manter o di logo mais pr ximo de uma conversa natural. Em tarefas com v rias etapas, a IA ainda pode informar o andamento do processo enquanto executa as a es necess rias. A intera o tamb m pode combinar voz e imagem. Com o uso da c mera, o Gemini consegue interpretar o ambiente em tempo real e usar essas informa es para responder ao usu rio. Entre os exemplos apresentados pelo Google est o o aux lio durante uma partida de xadrez e a orienta o de novos funcion rios durante um processo de integra o. Os modelos tamb m foram avaliados em diferentes benchmarks de voz. O Gemini 3.8 Live Extended Thinking alcan ou 82,6 pontos no Speech to Speech Quality Index, com o primeiro lugar geral, e 97,7% no Big Bench Audio. O modelo ainda registrou 68,6% no -Voice, que mede a conclus o de tarefas por agentes de voz, e 35,1% no -Voice-banking, voltado a tarefas do setor financeiro. J o Gemini 3.8 Live ficou em segundo lugar no Speech Agent Arena, que avalia a prefer ncia dos usu rios em intera es com agentes de voz. Para identificar conte dos produzidos pelos modelos, os udios gerados pelo Gemini Live recebem uma marca d' gua impercept vel por meio do SynthID. A tecnologia foi desenvolvida pelo Google para facilitar a detec o de conte do criado por intelig ncia artificial e aumentar a transpar ncia sobre a origem das grava es. Se voc gostou do conte do, talvez tamb m se interesse por conferir “4 ajustes para fazer antes de migrar do ChatGPT para o Gemini”. {{WHATSAPP_CHANNEL}}