Inteligência Artificial·11 min de leitura

Gemini 3.8 Flash e 3.8 Live: o que o Google lançou em setembro e qual modelo usar

O Flash passou o Pro, o 3.5 Pro não veio e a IA de voz ficou barata. O que cada lançamento muda na prática.

Em duas semanas de setembro, o Google lançou três modelos novos da família Gemini. No dia 2 saiu o Gemini 3.8 Flash, que o Google chama de seu melhor modelo de raciocínio e programação. No dia 15 saíram o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, modelos de conversa por voz em tempo real.

Este artigo explica o que cada um faz, quanto custa, como o 3.8 Flash se compara ao Gemini 3.1 Pro e o que aconteceu com o Gemini 3.5 Pro. No final, respondemos às perguntas mais comuns sobre a linha Flash.

Primeiro, os nomes: o que significa Flash, Pro e Live

A família Gemini tem vários modelos com o mesmo número de versão, e o sobrenome diz para que cada um serve.

Pro é o modelo maior e mais caro, feito para as tarefas mais difíceis. Flash é a versão rápida e barata, pensada para uso em volume: responder milhares de clientes, processar documentos em lote, rodar agentes que fazem dezenas de chamadas por tarefa. Flash-Lite é ainda menor e mais barato, para tarefas simples em escala muito alta. Live é a linha de voz: modelos que escutam e falam em tempo real, em vez de trocar texto.

O número indica a geração. Tudo que começa com 3 pertence à família lançada em novembro de 2025 com o Gemini 3 Pro. Desde então vieram o Gemini 3 Flash (dezembro de 2025), o Gemini 3.1 Pro (fevereiro de 2026) e uma sequência rápida de versões Flash: 3.5 em maio, 3.6 em julho, 3.7 em agosto e 3.8 em setembro.

Essa sequência explica o momento atual. O Google parou de lançar versões Pro e passou a atualizar o Flash a cada poucas semanas. O resultado é que, hoje, o Flash mais novo supera o Pro mais novo em várias tarefas, algo que seria impensável um ano atrás.

Gemini 3.8 Flash: o que mudou

O Gemini 3.8 Flash saiu em 2 de setembro de 2026, três semanas depois do 3.7 Flash. O Google o posiciona como seu modelo mais forte para programação, agentes autônomos e fluxos de trabalho longos, com a mesma velocidade e o mesmo custo do 3.7.

Os números publicados mostram onde está o ganho:

  • Terminal-Bench 2.1, que mede se o modelo completa tarefas reais de linha de comando do começo ao fim: 90,8%, contra 81,6% do 3.7 Flash.
  • DeepSWE v1.1, de engenharia de software em tarefas longas: 73,7%, contra 65,3% do 3.7 Flash.
  • Artificial Analysis Intelligence Index, um índice independente que agrega vários testes: 59 pontos no modo de raciocínio alto, três a mais que o antecessor.

O Google também destacou ganhos em testes de agentes para finanças e direito, sinal de que o alvo são tarefas corporativas com várias etapas, não só código.

O 3.8 Flash está disponível no Google AI Studio, na API do Gemini, no Gemini Enterprise, no Antigravity e no Android Studio. No app do Gemini, chegou primeiro aos assinantes dos planos Google AI Pro e Ultra. Também passou a responder no Modo IA da Busca e no Google Sheets.

E o 3.8 Flash Cyber?

Junto com o 3.8 Flash, o Google lançou uma variante especializada em segurança, o 3.8 Flash Cyber. Ele encontra vulnerabilidades e propõe correções em código, com mais de 70% de acerto na descoberta de falhas reais em 20 linguagens de programação. Por ser uma ferramenta que também serviria a atacantes, o acesso é restrito: só entram equipes de defesa, órgãos de governo, operadores de infraestrutura crítica e mantenedores de software aprovados no programa Fairwind.

Gemini 3.8 Flash vs 3.1 Pro: qual usar

Esta é a comparação mais buscada do momento, e a resposta curta é: para a maioria dos usos, comece pelo 3.8 Flash.

Em qualidade, o 3.8 Flash marca 59 pontos no índice da Artificial Analysis, contra cerca de 48 do 3.1 Pro. Em testes de programação, a vantagem do Flash é ainda mais clara.

Em custo, a diferença é grande. Na API, o 3.8 Flash custa US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, em preço promocional válido até 31 de dezembro de 2026. A partir de janeiro de 2027, passa para US$ 1,50 e US$ 7,50. O 3.1 Pro custa US$ 2,00 e US$ 12,00 para pedidos de até 200 mil tokens, e o dobro acima disso. Mesmo depois do reajuste, o Flash sai mais barato.

Em velocidade, o Flash começa a responder antes, o que importa em atendimento e em qualquer interface onde alguém está esperando.

Há uma ressalva. Benchmark mede tarefas padronizadas, e testes independentes feitos com projetos reais ainda divergem: em pelo menos uma comparação publicada, o 3.1 Pro entregou a implementação mais robusta, e o 3.8 Flash produziu o código mais limpo com o comportamento mais frágil. A regra prática é testar os dois com uma amostra do seu próprio trabalho antes de migrar algo crítico. O 3.1 Pro continua fazendo sentido em análises longas e delicadas, em que um erro custa mais que a diferença de preço.

E as comparações com as versões anteriores?

Se você viu comparações como "3.1 Pro vs 3.5 Flash", "3.6 Flash vs 3.1 Pro" ou "3.1 Pro vs 3.7 Flash", elas contam a mesma história em etapas. A cada versão, o Flash chegou mais perto do Pro nos testes de programação e agentes, a um custo muito menor. O 3.8 Flash é o ponto em que ele passa à frente no índice geral. Quem ainda usa uma dessas versões intermediárias em produção tem um motivo claro para testar a atualização, já que o 3.8 custa o mesmo que o 3.7.

E o Gemini 3.5 Pro?

O Gemini 3.5 Pro chegou a ser anunciado para junho de 2026, mas não foi lançado. O Google deixou o projeto de lado e concentrou esforço nas versões Flash, lançando quatro delas em quatro meses. Por isso, quem busca "Gemini 3.5 Pro" hoje não encontra o modelo: o Pro mais recente disponível continua sendo o 3.1 Pro, de fevereiro. Quando você vê "Gemini 3.5" em algum produto, quase sempre é o 3.5 Flash ou o 3.5 Flash-Lite.

Gemini 3.8 Live e 3.8 Live Extended Thinking: IA que conversa por voz

Os lançamentos de 15 de setembro são de outra categoria. Os modelos Live não trocam mensagens de texto: eles escutam, raciocinam e falam em tempo real, como numa ligação.

O Gemini 3.8 Live é a versão de uso geral, feita para escala e custo baixo. Entende o que a câmera mostra quase em tempo real, reconhece o idioma de quem fala e pode trocar de língua no meio da conversa, entre 97 idiomas suportados.

O Gemini 3.8 Live Extended Thinking é a versão para conversas complexas. Ele raciocina enquanto fala: em vez de ficar em silêncio pensando, usa frases curtas para manter a conversa andando enquanto trabalha no problema. É o modelo pensado para atendimento corporativo com várias etapas.

O que os dois têm de mais útil para empresas é a capacidade de usar ferramentas sem interromper a conversa. Enquanto fala com o cliente, o modelo pode consultar um sistema, verificar uma agenda ou buscar um pedido, e ainda narrar o que está fazendo, como um atendente que diz "só um minuto, estou vendo aqui".

Os números publicados:

  • 82,6 no índice de qualidade de fala para fala da Artificial Analysis.
  • 97,7% no Big Bench Audio, que mede raciocínio a partir de áudio.
  • 68,6% das tarefas completadas no τ-Voice, teste de agentes de voz executando tarefas reais.
  • 35,1% no τ-Voice banking, a versão bancária do mesmo teste.

Esse último número merece atenção. Um agente de voz que completa pouco mais de um terço das tarefas bancárias sozinho não está pronto para atender sem supervisão em cenários regulados. Ele já serve para agendar, tirar dúvidas e resolver pedidos simples, desde que haja um caminho claro para transferir o cliente a uma pessoa quando a tarefa ficar complicada.

Onde usar o 3.8 Live

Para quem usa o Gemini no dia a dia, o 3.8 Live aparece no app do Gemini, na Busca por voz (Search Live) e no Google Workspace, com recursos de voz no Docs, no Gmail e no Keep para assinantes Pro e Ultra.

Para desenvolvedores, os dois modelos estão na API do Gemini e no Google AI Studio, com integração pronta em ferramentas como LangChain, LiveKit e Vercel. Para empresas, estão em prévia privada no Vertex AI e no Gemini Enterprise.

Na API, o áudio custa US$ 0,005 por minuto de entrada e US$ 0,018 por minuto de saída. Uma ligação de dez minutos custa, no pior caso de os dois lados falarem o tempo todo, menos de 25 centavos de dólar em áudio. É um custo que torna viável colocar voz com IA em atendimento de pequenas e médias empresas.

O que isso muda na prática

Três conclusões para quem usa ou pretende usar IA no trabalho.

O Flash virou a escolha padrão. Com o 3.8, o modelo barato ficou bom o suficiente para a maior parte das tarefas de negócio. A pergunta deixou de ser "vale pagar pelo Pro?" e passou a ser "em quais tarefas o Pro ainda compensa?". Vale reavaliar integrações que foram construídas sobre modelos caros por falta de alternativa.

Aproveite o preço promocional, mas planeje o reajuste. O 3.8 Flash dobra de preço em janeiro de 2027. Se você está calculando o custo de um projeto, use o preço de 2027, não o de hoje.

Voz com IA ficou viável para atendimento. Custo de centavos por ligação, 97 idiomas e uso de ferramentas durante a conversa colocam o atendimento por voz ao alcance de empresas que antes só conseguiam automatizar texto. Os números de tarefas complexas mostram que a supervisão humana ainda é necessária, mas o primeiro atendimento já pode ser automático.

Perguntas frequentes

O que faz o Gemini 3 Flash?

O Gemini 3 Flash foi o primeiro modelo Flash da geração 3, lançado em 17 de dezembro de 2025, quando também virou o modelo padrão do app do Gemini para todos os usuários, inclusive os do plano gratuito. Como todo Flash, é um modelo rápido e barato para tarefas em volume: responder perguntas, resumir textos, classificar documentos, escrever código e alimentar agentes. Hoje ele é considerado uma versão antiga. As versões 3.5, 3.6, 3.7 e 3.8 Flash o substituíram, com ganhos grandes em programação e em tarefas com várias etapas.

O Gemini Flash é gratuito?

Em boa parte, sim. Na API do Gemini, os modelos 3.5, 3.6, 3.7 e 3.8 Flash têm um nível gratuito, com limites de uso por minuto e por dia, suficiente para testar e para projetos pequenos. Acima desses limites, a cobrança é por token. No app do Gemini, o plano gratuito também usa a linha Flash, com limites de uso menores. As versões mais novas, como o 3.8 Flash, chegaram primeiro aos assinantes dos planos Google AI Pro e Ultra.

O que significa Flash no Gemini?

Flash é o nome que o Google dá à linha de modelos rápidos e de custo baixo da família Gemini. Fica entre o Pro, maior e mais caro, e o Flash-Lite, menor e mais barato. O nome indica a proposta: responder rápido, em volume, com qualidade suficiente para a maioria das tarefas.

Qual é o valor do Gemini 3 Flash?

Na API, o Gemini 3 Flash custa US$ 0,50 por milhão de tokens de entrada e US$ 3,00 por milhão de tokens de saída, e não tem mais nível gratuito. Para projetos novos, compensa usar o 3.8 Flash: ele custa US$ 0,75 e US$ 3,75 até o fim de 2026, tem nível gratuito e entrega resultados muito melhores. Para quem usa pelo app, o Flash está incluído na conta Google e nos planos Google AI Pro e Ultra, sem cobrança por uso.

Qual o melhor modelo Gemini hoje?

Depende da tarefa. Para a maioria dos usos, incluindo programação e agentes, o Gemini 3.8 Flash oferece a melhor combinação de qualidade, velocidade e preço. Para análises longas em que robustez importa mais que custo, vale testar o Gemini 3.1 Pro. Para conversa por voz em tempo real, o Gemini 3.8 Live.


Modelos melhores e mais baratos só viram resultado quando estão ligados à operação: à agenda, ao CRM, ao canal onde o cliente de fato manda mensagem. O Sharpfy CRM coloca uma recepcionista com IA no WhatsApp, respondendo e agendando 24 horas por dia. E se você quer usar os modelos Gemini numa integração própria, com voz, agentes ou os seus sistemas internos, a Sharpfy constrói sob medida.