個人で作っている音声会話システムを調整していたところ、ChatGPT側のUI変更に引っかかった。
読み上げ終了後、自動で音声入力を始めるはずが、なぜかChatGPT標準のVoiceモードが起動する。
私の中では、あの女性音声はすでに「おばちゃん」である。
調べてみると、現在の入力欄付近には音声関係のボタンが2つあった。
DictateStart Voice
名前だけ見ると似ているが、役割は別物だった。
Dictate=音声を文字入力するStart Voice=ChatGPTのVoiceモードを開始する
つまり、おばちゃんを召喚していた犯人は Start Voice だった。
Consoleから、
document.querySelector( 'button[aria-label="Dictate"]')?.click();
を試すと、欲しかった通常の音声入力が始まった。
音声入力中は、
Cancel dictationStop dictation
に変化し、停止後は Send、送信後は再び Dictate に戻る。
現在使っている流れは、
Dictate↓話す↓「セバスチャン」↓Stop dictation↓Send
というもの。
ちなみに「セバスチャン」は終了ワードとして使っている。
冗談半分で選んだ名前だったが、普通の会話に混ざりにくく、音声認識もかなり安定している。終了ワードとして非常に優秀だった。
今回の原因は、複雑な音声認識処理ではなかった。
押しているボタンが違っただけ。
Start Voice をやめて Dictate を使うことで、標準Voiceモードを起動せずに音声入力だけ利用できるようになった。
おばちゃん封印成功。





コメントを残す