Gemini passa a escolher quais trechos de um vídeo assistir e corta em até 88% o uso de tokens

Gemini ganha análise agêntica de vídeos, escolhe quais trechos assistir e reduz tokens em até 88% e custos em até 66%.

O Gemini ganhou um modo de análise de vídeo em que a própria IA decide quais trechos precisa assistir, em que velocidade e por qual sinal — imagem, áudio ou transcrição.

O Google chama a novidade de compreensão de vídeo agêntica e afirma que ela reduz o consumo de tokens em até 88%.

A mudança, porém, não chegou como um botão novo no aplicativo comum do Gemini.

Neste primeiro momento, o recurso atende desenvolvedores e empresas por meio da Gemini API no Google AI Studio e da Gemini Enterprise Agent Platform.

Como o Gemini escolhe quais partes do vídeo analisar

No processamento tradicional, um modelo costuma ler o vídeo em uma taxa fixa de quadros por segundo. Isso obriga a IA a consumir muitos trechos que talvez não tenham relação com a pergunta do usuário.

Com o modo agêntico, o Gemini passa a trabalhar em ciclos. Ele interpreta a pergunta, procura os momentos mais relevantes e pode voltar a determinados trechos com outra taxa de quadros.

Também cruza frames, áudio e transcrição para decidir de onde tirar a resposta.

Na prática, a IA pode acelerar partes pouco importantes e examinar com mais detalhe um movimento rápido, uma mudança de cena ou um momento específico em uma gravação longa.

Economia chega a 88% em tokens e 66% em custo

Nos testes que o Google apresentou, a compreensão agêntica de vídeo trouxe três ganhos principais:

  • até 88% menos consumo de tokens;
  • até 66% menos custo de análise;
  • até 7% de melhora na precisão em benchmarks de vídeo.

Os números representam os melhores resultados que os testes registraram, não uma garantia para qualquer vídeo.

O benefício tende a aparecer com mais força em conteúdos longos, como aulas de 90 minutos, tutoriais e gravações de várias horas.

Logo do Gemini

Imagem: Reprodução

Quais modelos do Gemini já suportam o recurso

O Google liberou a função para:

  • Gemini 3.7 Flash;
  • Gemini 3.6 Flash; e
  • Gemini 3.5 Flash-Lite.

Entre eles, a empresa destaca o 3.7 Flash como a opção com melhor combinação entre qualidade e custo nas avaliações apresentadas.

O recurso funciona tanto com vídeos que o usuário envia quanto com vídeos do YouTube.

Para desenvolvedores, a ativação ocorre pela configuração da API no modo “agentic”.

O que muda para quem cria ferramentas com vídeo

A principal vantagem está em reduzir o trabalho de montar manualmente pipelines que cortam vídeos, escolhem frames e repetem análises.

Dessa forma, o próprio Gemini passa a controlar esse processo conforme a pergunta.

Isso abre espaço para usos como localizar um instante exato em uma gravação, detectar anomalias, contar movimentos repetidos e buscar uma informação específica em horas de conteúdo sem alimentar o modelo com o vídeo inteiro da mesma forma.

Para usuários do app Gemini, a novidade não significa que todo vídeo enviado no chat já usa automaticamente esse modo.

O Google direciona o anúncio atual à API e à plataforma empresarial.

Portanto, o leitor deve interpretar a redução de até 88% como uma melhoria de infraestrutura para produtos e serviços que adotarem a nova configuração.

O que você achou? Siga @bitmagazineoficial no Instagram para ver mais e deixar seu comentário clicando aqui

Jogos recomendados

Moyses Batista
Escrito por

Moyses Batista