WhiziのAI音声会話:ボイスモードの仕組み

簡潔な回答

Whiziのボイスモードはリアルタイムの音声会話です。あなたが話すとモデルが声で答え、その途中で割り込むこともできます。すべての有料プランにボイス利用時間が含まれており、Starterは月10分、Proは80分、Powerhouseは500分です。ボイスの利用時間は独自の計測枠で動き、クレジットを消費しません。すべてのセッションはチャット履歴に文字起こしとして残ります。

結論から言うと

ボイスモードはリアルタイムの音声会話です。あなたが話すとモデルが声で答え、その途中で割り込むこともできます。すべての有料プランにボイス利用時間が含まれます。Starterは月10分、Proは80分、Powerhouse500分です。

セッションが終わると文字起こしがチャット履歴に残るため、話した会話もタイピングした会話と同じように後から読み返せます。ボイスの利用時間は独自の計測枠で数えられ、クレジットは消費しません。

セッションの開始と操作

チャットからボイスモードを開くと、セッションが接続してすぐに音声を聞き取り始めます。プッシュトゥトークの操作は不要で、そのまま話し始めるだけです。応答は決められた1つの声、Sulafatという温かみのある声で返ってきます。ボイスはGemini Live API上で動作しており、Whiziは短命なセッショントークンを発行し、ブラウザからGoogleへ音声が直接ストリーミングされるため、音声がWhiziのサーバーを通ることはありません。

セッション中の操作はあえて最小限に絞られています。マイクをミュートすればセッションを終了せずに音声を拾うのを止められ、セッションそのものを終了することもできます。状態インジケーターは今Whiziが聞いているのか話しているのかを示しており、これは見た目以上に重要です。自分の言葉が聞き取られているかどうかがわかることこそ、音声インターフェースを我慢できるものにする一番の要素だからです。

会話がターン制ではなくリアルタイムであるため、モデルがまだ話している途中でも、人と話すときと同じように割り込むことができます。これがなければ、長く間違った答えを最後まで聞いてから軌道修正するしかありません。

文字起こしはセッションの途中も含めて、いつでもチャット内で開けます。何かを正確に把握したいときの逃げ道はこれです。想像するのではなく、実際に記録された内容を読むのです。名前や数字、専門用語の音声認識はどの音声インターフェースでも最も弱い部分なので、セッションの途中で文字起こしを確認することが、聞き取りミスが次の回答に影響する前に見つける一番速い方法です。

利用時間の数え方

利用時間はセッションの時間を数えており、この割り当てはアカウント単位で計算され、請求期間ごとにリセットされます。1回のセッションは最大15分までです。開始時に割り当てから時間が確保され、セッションの実行可能時間が伝えられるため、残り時間がそれより少ない場合はセッションがその分だけ短く調整されます。

割り当てはプランに応じて決まります。Starterは月10分、Proは80分、Powerhouse500分です。無料アカウントには割り当てがありません。Powerhouseは月に8時間強、平日1日あたりおよそ20分に相当します。音声会話は自然と短くなりやすく、この形式は1時間続くセッションよりも5分程度のやり取りに向いているため、上位プランの上限が制約になることはほとんどありません。

マイクをミュートしても時間は止まりません。止まるのはセッションを終了したときだけです。席を外すときはミュートではなく終了してください。

ボイスの利用時間はそれ自体が独立した割り当てで、他の何かを消費することはありません。ボイスの利用時間、クレジット、画像生成はそれぞれ別の計測枠で共有プールを持たないため、長い音声会話をしても、その月に送れるClaudeやGPTのメッセージ数が減ることはありません。同様に、クレジットを使い切ったアカウントでもボイスの利用時間は残っており、ボイスの利用時間を使い切ったアカウントでもタイピングは続けられます。

セッションが残す文字起こしは通常のチャットとして扱われるため、保存するのに追加の費用はかからず、タイピングしたものと同じ履歴に並びます。

音声が本当に優れている点

音声はタイピングの速い版ではなく、そう使おうとすると期待外れになります。音声が本当に勝る3つの場面があります。

声に出して考える。 まだ整理できていない問題を話しながら考えるのは、書くよりずっと楽です。文の終わりが見える前に、その一文にコミットする必要がないからです。後から見る文字起こしは、自分でタイピングしたものよりも問題の説明として優れていることがよくあります。

手がふさがっている、目が離せない。 料理中、運転中、歩いている最中、あるいは体を動かしながらの作業中です。これは最もわかりやすい例で、実際に効果があります。

会話の練習をする。 面接の受け答え、クライアントへの言いにくいメッセージ、ピッチなどです。声に出して言い、返答を聞くことで、紙の上では問題なく見えたぎこちない言い回しが浮かび上がります。

音声が不利な場面は、コード、正確な数字、綴りが難しい名前、コピーしたくなるような長い構造化された出力を扱うときです。これらはタイピングしてください。

していること音声かタイピングか理由
まだ整理できていない問題を考える音声文の終わりが見える前に、その一文にコミットする必要がない
料理中、運転中、歩いている最中、体を動かしながらの作業音声手がふさがり目が離せない上、後から文字起こしが履歴に残る
面接の受け答え、言いにくいメッセージ、ピッチの練習音声声に出すことで、紙の上では問題なく見えたぎこちない言い回しが浮かび上がる
コード、正確な数字、綴りが難しい名前、コピーする長い出力タイピング音声認識は名前、数字、専門用語に最も弱い
チェックリスト
  • すべての有料プランにボイスが含まれる:Starter10分、Pro80分、Powerhouse500分
  • 1回のセッションは最大15分
  • ボイスはクレジットを消費せず、独自の計測枠を持つ
  • ミュートしても時間は止まらず、セッションを終了すると止まる
  • 文字起こしはチャット履歴に残り、後から読み返せる
  • コード、正確な数字、コピーしたいものはタイピングを使う

よくある質問

どのプランにボイスモードが含まれますか?

すべての有料プランにボイスモードが含まれており、無料アカウントにはボイスの利用時間がまったくありません。プランによって変わるのは割り当てです。Starterは月10分、Proは80分、Powerhouseは500分のボイス利用時間を含み、請求期間ごとにリセットされます。

ボイスの利用時間はクレジットから引かれますか?

いいえ。ボイスは独自の分単位の計測枠を持ち、クレジットは消費しません。そのため、長い音声会話をしても、送れるClaudeやGPTのメッセージ数が減ることはありません。ボイスの利用時間、クレジット、画像生成は共有プールを持たない別々の割り当てです。

ボイスセッションで自分が話した内容を確認できますか?

はい。すべてのセッションはチャット履歴に残る文字起こしを生成し、セッション中はもちろん、終了後にも開くことができます。名前、数字、専門用語は音声認識が最も間違えやすい部分なので、精度が重要な場面ではセッション途中の確認を取る価値があります。

モデルが話している途中で割り込めますか?

はい、会話はターン制ではなくリアルタイムなので、人と話すときと同じように割り込むことができ、モデルはそこで止まります。そうしなければ、長く間違った答えを最後まで聞くしかありません。