A resposta rápida
O modo de voz é uma conversa falada em tempo real: você fala, o modelo responde em voz alta, e você pode interromper. Todo plano pago inclui minutos de voz: 10 por mês no Starter, 80 no Pro e 500 no Powerhouse.
A sessão gera uma transcrição que vai para o seu histórico de conversas, então uma conversa falada pode ser relida depois, assim como uma digitada. Os minutos de voz são contados em um medidor próprio e não gastam créditos.
Iniciando e controlando uma sessão
Abra o modo de voz a partir do chat, e a sessão se conecta e começa a ouvir. Não existe uma etapa de apertar para falar: você simplesmente começa a falar. As respostas vêm em uma voz predefinida, uma voz calorosa chamada Sulafat, e a voz roda sobre a Gemini Live API: a Whizi gera um token de sessão de curta duração e o seu navegador transmite o áudio diretamente para o Google, então nenhum áudio passa pelos servidores da Whizi.
Os controles durante uma sessão são deliberadamente mínimos. Você pode silenciar o microfone, o que impede que ele te ouça sem encerrar a sessão, e você pode encerrar a sessão por completo. O indicador de estado mostra se a Whizi está ouvindo ou falando no momento, o que importa mais do que parece, porque saber se você foi ouvido é a maior parte do que torna uma interface de voz tolerável.
Como a conversa é em tempo real e não por turnos, você pode interromper enquanto o modelo ainda está falando, do mesmo jeito que faria com uma pessoa. Sem isso, uma resposta longa e errada teria que ser esperada até o fim antes de você conseguir redirecioná-la.
A transcrição pode ser aberta no chat a qualquer momento, inclusive no meio da sessão. Essa é a saída de emergência quando algo precisa ser preciso: ler o que foi realmente captado em vez de presumir. O reconhecimento de fala em nomes, números e termos técnicos é a parte mais fraca de qualquer interface de voz, então dar uma olhada na transcrição no meio da sessão é a forma mais rápida de pegar um erro de entendimento antes que ele molde a próxima resposta.
Como os minutos são contados
Os minutos contam o tempo de sessão, e a cota é contada por conta e reinicia com o seu ciclo de cobrança. Uma única sessão dura no máximo 15 minutos: a chamada de início reserva tempo da sua cota e informa à sessão por quanto tempo ela pode rodar, então quando os seus minutos restantes são menores que isso, a sessão é encurtada para caber.
A cota acompanha o plano: 10 minutos por mês no Starter, 80 no Pro e 500 no Powerhouse. Contas gratuitas não recebem nenhum. O Powerhouse dá pouco mais de oito horas por mês, ou aproximadamente vinte minutos em cada dia útil. Conversas por voz são naturalmente curtas, o formato serve mais a trocas de cinco minutos do que a sessões de uma hora, então os planos mais altos raramente são um limite real.
Silenciar o microfone não para o relógio. Encerrar a sessão, sim. Se você for se ausentar, encerre a sessão em vez de apenas silenciar.
Os minutos de voz são uma cota própria e não puxam de mais nada. Minutos de voz, créditos e gerações de imagem são medidores separados que não compartilham um mesmo grupo, então uma conversa longa por voz não reduz o número de mensagens de Claude ou GPT que você pode enviar naquele mês. Isso também significa que uma conta que zerou os créditos ainda tem seus minutos de voz, e uma conta que esgotou a cota de voz falando ainda pode digitar.
A transcrição que uma sessão deixa é um chat comum, então não custa nada a mais para manter e fica no seu histórico junto com tudo o que você digitou.
No que a voz realmente é melhor
A voz não é uma versão mais rápida de digitar, e usá-la assim é decepcionante. Três casos em que ela realmente ganha:
Pensar em voz alta. Falar sobre um problema que você ainda não estruturou é bem mais fácil do que escrever, porque você não precisa se comprometer com uma frase antes de saber onde ela termina. A transcrição depois costuma descrever o problema melhor do que qualquer coisa que você teria digitado.
Mãos ocupadas ou olhos em outro lugar. Cozinhando, dirigindo, caminhando, ou lidando com algo físico. Esse é o caso óbvio, e é real.
Ensaiando uma conversa. Respostas de entrevista, uma mensagem difícil para um cliente, um pitch. Dizer em voz alta e ouvir uma resposta revela a formulação estranha que parece boa no papel.
Onde ela perde: qualquer coisa com código, números exatos, nomes difíceis de soletrar, ou saída estruturada longa que você vai querer copiar. Digite essas.
| O que você está fazendo | Falado ou digitado | Por quê |
|---|---|---|
| Pensar sobre um problema que você ainda não estruturou | Falado | Você não precisa se comprometer com uma frase antes de saber onde ela termina |
| Cozinhar, dirigir, caminhar, ou lidar com algo físico | Falado | As mãos estão ocupadas e os olhos em outro lugar, e a transcrição fica no seu histórico depois |
| Ensaiar respostas de entrevista, uma mensagem difícil, ou um pitch | Falado | Dizer em voz alta revela a formulação estranha que parece boa no papel |
| Código, números exatos, nomes difíceis de soletrar, saída longa que você vai copiar | Digitado | O reconhecimento de fala é mais fraco em nomes, números e termos técnicos |
- Todo plano pago inclui voz: 10 minutos no Starter, 80 no Pro, 500 no Powerhouse
- Uma única sessão dura no máximo 15 minutos
- A voz não gasta créditos, ela tem seu próprio medidor
- Silenciar não para o relógio, encerrar a sessão sim
- A transcrição vai para o histórico do chat e continua relegível
- Use a digitação para código, números exatos e qualquer coisa que você vai copiar
Perguntas frequentes
Qual plano inclui o modo de voz?
Todo plano pago inclui o modo de voz, e contas gratuitas não recebem nenhum minuto de voz. A cota é o que muda com o nível: o Starter inclui 10 minutos de voz por mês, o Pro inclui 80, e o Powerhouse inclui 500, reiniciando com o ciclo de cobrança.
Os minutos de voz saem dos meus créditos?
Não. A voz tem seu próprio medidor de minutos e não gasta créditos, então uma conversa longa por voz não reduz o número de mensagens de Claude ou GPT que você pode enviar. Minutos de voz, créditos e gerações de imagem são cotas separadas que não compartilham um mesmo grupo.
Posso ver o que eu disse em uma sessão de voz?
Sim. Toda sessão gera uma transcrição que vai para o seu histórico de conversas, e você pode abri-la durante a sessão, além de depois. Vale a pena dar essa olhada no meio da sessão sempre que a precisão importar: nomes, números e termos técnicos são o que o reconhecimento de fala mais erra.
Posso interromper o modelo enquanto ele está falando?
Sim, a conversa é em tempo real e não por turnos, então você pode interromper do mesmo jeito que faria com uma pessoa, e o modelo para em vez de terminar uma resposta longa e errada que você teria que esperar até o fim.