会議のアジェンダを渡しておくと良さそう。
人間の同時通訳でも言語だけでなく、専門的な内容の場合前提知識もある程度ないといけないのと同じだ
AIもプロンプトや前提文脈がないと頓ちんかんな文字起こしするの人間っぽくて草
内容を読む前は「"先に言っといて"はAIにも効く」の意図がわからなかったが、AIだって前提知識は重要だろう。前提知識のあるなしは認識に影響するのは自明
母親「だから言ったじゃない」
音素にしてから修正ではなく、音素の取り方が良くなる…のかな?
先に言っといてってなに??どこにも書いてない
つまり仮文字起こしで『先に』を作ってから本番文字起こしをしろってことかな?(・ω・)
“文字起こしの精度を引き上げるため、開発者がAPI呼び出し時に録音内容を想定してコンテキストを入力できる点” これが「先に言っといて」部分だが文字列パターンマッチでは見つからないので読者が混乱してる模様
人間でも会話テーマの事前情報あったほうが聞き取り精度はあがるしな
ダメダメな自動書き起こしに、概要やプレゼン資料を渡して清書してもらっている
large-v3-turboで録音/文字起こしツール作ったけど、精度が低くてもAIに修正させると有料ソフト並みの品質になるんだよなあ。
この「効く」っていう表現を見るとAIが書いたなって思っちゃう
"先に言っといて"という言葉がAIに効くかのような見出しに見えるけどそういう話じゃないのか?
専門用語などのドメイン知識をコンテキストとして入力することで、認識精度を向上させることができますよと言う話。
件名で使った「先に言っといて」は、記事本文にも入れてほしい。
whisperの後継もオナシャス
人と同じでコンテキストを、前提条件や背景、用語などを事前に説明しておくと会話で分からない所で突っかかることが減って理解、納得が早くなるように、AIによる文字起こしも誤認識が減るということなのだろう。
直接記事とは関係ないが、文字起こしやその校正ってLLMにやらせるとトークン消費量が凄いことをGeminiにYouTubeの自動文字起こしの校正と話者分割をやらせてみて分かった。
コンテキストのないWhisperとか、聞き取れないとすぐ「チャンネル登録お願いします」と学習データに多かったであろう書き起こしをするからな。そういうの減らせてよさそう
“自由記述のコンテキストをはじめ、人名や業界専門用語のキーワード、想定される入力言語、さらには直前の会話履歴ターンなどをモデルに提供することで、音声認識の文脈理解がより確実になるという。”
"先に言っといて"はAIにも効く。OpenAIの新文字起こしは誤認識が半減
会議のアジェンダを渡しておくと良さそう。
人間の同時通訳でも言語だけでなく、専門的な内容の場合前提知識もある程度ないといけないのと同じだ
AIもプロンプトや前提文脈がないと頓ちんかんな文字起こしするの人間っぽくて草
内容を読む前は「"先に言っといて"はAIにも効く」の意図がわからなかったが、AIだって前提知識は重要だろう。前提知識のあるなしは認識に影響するのは自明
母親「だから言ったじゃない」
音素にしてから修正ではなく、音素の取り方が良くなる…のかな?
先に言っといてってなに??どこにも書いてない
つまり仮文字起こしで『先に』を作ってから本番文字起こしをしろってことかな?(・ω・)
“文字起こしの精度を引き上げるため、開発者がAPI呼び出し時に録音内容を想定してコンテキストを入力できる点” これが「先に言っといて」部分だが文字列パターンマッチでは見つからないので読者が混乱してる模様
人間でも会話テーマの事前情報あったほうが聞き取り精度はあがるしな
ダメダメな自動書き起こしに、概要やプレゼン資料を渡して清書してもらっている
large-v3-turboで録音/文字起こしツール作ったけど、精度が低くてもAIに修正させると有料ソフト並みの品質になるんだよなあ。
この「効く」っていう表現を見るとAIが書いたなって思っちゃう
"先に言っといて"という言葉がAIに効くかのような見出しに見えるけどそういう話じゃないのか?
専門用語などのドメイン知識をコンテキストとして入力することで、認識精度を向上させることができますよと言う話。
件名で使った「先に言っといて」は、記事本文にも入れてほしい。
whisperの後継もオナシャス
人と同じでコンテキストを、前提条件や背景、用語などを事前に説明しておくと会話で分からない所で突っかかることが減って理解、納得が早くなるように、AIによる文字起こしも誤認識が減るということなのだろう。
直接記事とは関係ないが、文字起こしやその校正ってLLMにやらせるとトークン消費量が凄いことをGeminiにYouTubeの自動文字起こしの校正と話者分割をやらせてみて分かった。
コンテキストのないWhisperとか、聞き取れないとすぐ「チャンネル登録お願いします」と学習データに多かったであろう書き起こしをするからな。そういうの減らせてよさそう
“自由記述のコンテキストをはじめ、人名や業界専門用語のキーワード、想定される入力言語、さらには直前の会話履歴ターンなどをモデルに提供することで、音声認識の文脈理解がより確実になるという。”