質的インタビューのための音声分析:感情・プロソディ・ためらい(2026)
執筆:Fengming Liu(UCL)· 監修:Prof. Shubin Yu(HEC Paris) · May 2026 · 更新日: 2026-05-30 · 14 min read
インタビューの逐語記録を読めば、言葉は捉えられます。しかし、難しい答えの前の長い間、デリケートなトピックが出たときに張りつめる声、ほとばしる熱意、慎重なためらいは失われます。質的研究では、あることがどのように言われるかが、何が言われるかと同じくらい意味を運ぶことがよくあります——そしてそれこそが、音声分析が回復するために設計されたものです。
このガイドは、質的研究者のために音声分析を説明します:何を測定するか、どう機能するか、逐語記録ベースの分析をどう補完するか、そしてその限界と倫理的責任がどこにあるか。周辺の分析プロセスについては、質的データ分析ガイドをご覧ください。
音声分析とは何か?
音声分析とは、発話の声の、非言語的な性質——トーン、ピッチ、ペース、間、感情の手がかり——の計算的分析で、言葉そのものを超えた意味を抽出します。インタビュー録音に適用すると、質的知見にパラ言語的な層を加え、書かれた逐語記録が平板化してしまう感情的・相互作用的な肌理を捉えます。
それはパラ言語を研究します:文字通りの言葉を除く発話のあらゆるもの。2人が「私は大丈夫」を正反対の意味で言うことができ、音声分析はその違いを分析可能なデータにするものです。
質的研究で声がなぜ重要か
質的研究は意味を気にかけ、意味は一部、伝え方に宿ります。ためらいは不快感か慎重な思考を示しうる;ピッチの上昇は興奮かストレスを示しうる;速いペースは熱意か不安を伝えうる。これらの手がかりは、研究者が感情的に重要な瞬間を見つけ、言葉だけでは隠れる両面性を検出し、参加者が単に述べたことではなく本当に感じたことを解釈するのを助けます。
音声分析が測定するもの
感情とアフェクト
発話の感情的なトーン——例えば肯定的、否定的、あるいはストレスや熱意のような特定の状態——と、それがインタビュー全体でどう移り変わるかを分類します。
プロソディ
発話の音楽的な性質:ピッチ(高い/低い)、抑揚(フレーズの旋律)、音量、リズム。プロソディは、多くの感情的・強調的な意味が符号化される場所です。
ためらいと非流暢性
間、フィラー(「えーと」「あー」)、言い直し、修復。ためらいのパターンは、不確かさ、不快感、認知的負荷、あるいはデリケートなトピックの接近を示しうる。
発話速度と声のダイナミクス
どれだけ速く話すか、そして伝え方が時間を通じてどう変わるか——遅くなる声、突然の速まり——会話を通じた関与と感情のダイナミックなプロファイルを提供します。
どう機能するか
パイプラインは音を特徴へ、特徴を解釈へと変えます:音声が処理されて音響的特徴(ピッチの輪郭、エネルギー、タイミング、間)が抽出され、機械学習または深層学習のモデルがそれらの特徴を感情やストレスのようなより高次のラベルに対応づけます。出力は典型的に、声と感情のシグナルがインタビュー全体でどう動くかを示すタイムライン——逐語記録に整列した感情のタイムライン——です。
音声分析と逐語記録分析の比較
| 側面 | 逐語記録分析 | 音声分析 |
| 捉えるもの | 言われた言葉 | 言葉がどう言われたか |
| 強み | 内容、テーマ、言語の意味 | 感情、強調、ためらい、ダイナミクス |
| 見逃すもの | トーン、間、アフェクト | 意味内容 |
| 最適な役割 | 一次分析 | 補完的な層 |
両者はライバルではなくパートナーです。音声分析は、そのシグナルが逐語記録ベースのコーディングに重ねられ、解釈を置き換えるのではなく豊かにするときに最も強力です。
研究における用途
- 感情のピークの特定 ——長いインタビューの中でアフェクトが急上昇する瞬間を素早く見つける。
- 両面性の検出 ——自信に満ちた言葉と不確かな伝え方の間のギャップを浮かび上がらせる。
- デリケートなトピックの研究 ——言語的にではなく声で示される不快感を特定する。
- 比較分析 ——参加者間やグループ間で感情のダイナミクスを比較する。
- フォーカスグループ ——複数の話者にわたって関与と反応を追う。
強みと限界
強み:文字起こしで失われる意味を回復し、長い録音にわたってスケールし、声のダイナミクスの客観的でタイムスタンプ付きの記録を与える。
限界:声からの感情認識は確実ではなく確率的である;声の表現は文化・個人・言語によって変わるため、ラベルを額面通りに受け取ると誤導しうる;音声の品質が結果に強く影響する;そして自動化された「感情検出」の妥当性は活発に議論されている。出力を、評決ではなく調査すべきシグナルとして扱ってください。
音声をテーマ分析と統合する
実践的なワークフローは、感情のタイムラインをコード化された逐語記録と整列させることです。テーマが声の急上昇と共起するとき——あなたがコード化したトピックを参加者が論じるまさにそのときに声が張りつめるとき——どちらの源だけよりも強い、トライアンギュレートされた証拠を得ます。声のシグナルを使って精聴を導いてください:旗立てされた瞬間に音声へ戻り、ラベルをそのまま信頼するのではなく文脈の中で解釈します。
倫理
- 同意 ——参加者は、自分の声が単に文字起こしされるだけでなく、感情的・声的な手がかりについて分析されることを知るべきである。
- 過度の主張を避ける ——確率的な感情推定を確定的な心理学的事実として提示しない。
- 文化的感受性 ——集団によって感情が声でどう表現されるかの変動を考慮する。
- プライバシー ——声は生体データである;安全に保存し処理する。
ツール
専用のプラットフォームが音響処理を代行します。QualiTaTiのVoice Analyticsは、インタビュー音声から感情検出、発話パターンとためらいの追跡、声のダイナミクス分析を提供し、各インタビューについて、コード化された逐語記録と整列できる感情のタイムラインを生成します。
実例
- 録音して文字起こしする ——デリケートな健康トピックに関する15件のインタビューのクリーンな音声を捉え、文字起こしする。
- 音声分析を実行する ——各インタビューについて感情のタイムラインとためらいのプロファイルを生成する。
- 逐語記録をコード化する ——通常通りテーマを開発する。
- 整列する ——感情のタイムラインをコード化された逐語記録に重ね、声の急上昇が特定のテーマと出会うところを記す。
- 解釈する ——それらの瞬間に音声へ戻り、精聴で確認し、声の証拠を引用とともに報告する。
要点
- 音声分析は、あることがどう言われたか——トーン、ピッチ、ペース、ためらい——を分析し、逐語記録が失う意味を回復する。
- 感情、プロソディ、ためらい/非流暢性、発話のダイナミクスを、しばしば感情のタイムラインとして測定する。
- 逐語記録ベースのテーマ分析を置き換えるのではなく補完する。
- 出力は確率的で文化によって変わるため、評決ではなく精聴のためのシグナルとして扱う。
- 声は生体データである——同意、プライバシー、過度の主張を慎重に扱う。
よくある質問
音声分析とは何か?
音声分析とは、発話の非言語的な性質——トーン、ピッチ、ペース、間、感情の手がかり——の計算的分析で、言葉を超えた意味を抽出し、インタビュー分析にパラ言語的な層を加えます。
音声分析はインタビューの中で何を検出できるか?
感情的なトーンを推定し、プロソディ(ピッチ、抑揚、音量、リズム)を地図化し、ためらいと非流暢性を追跡し、会話全体の発話速度と声のダイナミクスを、しばしばタイムラインとして測定できます。
音声分析は文字起こしとどう違うか?
文字起こしは言われた言葉を捉える;音声分析はそれがどう言われたかを捉える。逐語記録分析は内容とテーマを扱い、音声分析は感情・強調・ためらいを加える——両者は併用すると最もよく機能します。
声の感情検出は正確か?
確定的ではなく確率的です。感情表現は個人・文化・言語によって変わり、音声の品質も重要なので、結果は確かな事実としてではなく、精聴を通じて調査すべきシグナルとして扱うべきです。
音声分析をテーマ分析とどう組み合わせるか?
感情のタイムラインをコード化された逐語記録と整列させます。声の急上昇がコード化されたテーマと共起するところで、トライアンギュレートされた証拠を得ます;それらの瞬間に音声へ戻り、文脈の中で解釈します。
声を分析することに倫理的な懸念はあるか?
はい。声は生体データなので、声の分析についてインフォームド・コンセントを得て、録音を安全に保存し、検出された感情について過度に主張するのを避け、声の表現における文化的差異を考慮してください。