検索パネルを開く 検索パネルを閉じる メニューを開く メニューを閉じる

2026年9月28日

お知らせ

音声言語処理における世界最大の国際学会Interspeech2026に、NTTから14本の論文が採択

2026年9月27日~10月1日にオーストラリアのシドニーで開催される国際会議Interspeech2026(the 27th edition of the Interspeech Conference)当該ページを別ウィンドウで開きますに、NTTの研究所より提出された14本の論文が採択されました。Interspeechは、人と人、人と計算機/AIの音声コミュニケーションを支える音声言語処理の技術および科学に関する世界最大かつもっとも包括的な国際会議で、音声認識・音声合成・音声対話から音声学まで、幅広い分野を対象としています。またInterspeechの会場では、これらの採録論文に加えて、重要な分野の動向を解説するチュートリアルでも発表予定です。

なお、所属としてそれぞれ略称で書かれている研究所名は、以下の通りです(所属は投稿時点)。
CS研:コミュニケーション科学基礎研究所
人間研:人間情報研究所
CMU:Carnegie Mellon University
BUT:Brno University of Technology

■Tight Boundary Prediction in Speaker Diarization Using Causal-Anticausal Consistency
(因果的・反因果的推論の一貫性に基づいた厳密な発話区間を推定可能な話者ダイアライゼーション)

堀口 翔太 リサーチスペシャリスト(人間研)、デルクロア マーク 特別研究員(CS研)、俵 直弘 主任研究員(CS研)、芦原 孝典 主任研究員(人間研)、安藤 厚志 主任研究員(人間研)

話者ダイアライゼーションは音声からいつ誰が発話したのかを推定するタスクです。精度の良い話者ダイアライゼーションモデルを得るには、話者毎に発話区間が付与された会話データが大量に必要となりますが、その発話区間ラベルの厳密性がモデルの出力に大きく影響します。本研究では、あまり厳密でないラベルを自動で修正し、修正したラベルに基づいてモデルを学習することで,厳密な発話区間を推定可能なモデルを実現しました。本成果は、会議や商談といった複数人が発話する状況における音声の認識・理解への活用が期待されます。

■Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics
(誰が、いつ、何を話したのか?:意味と発話重複を考慮した対話音声認識評価指標による音声言語モデルの評価)

俵 直弘 主任研究員(CS 研)、Samuele Cornell(CMU)、Alexander Polok(CMU)、マーク デルクロア 特別研究員(CS 研)、Lukáš Burget(BUT)、Shinji Watanabe(CMU)

近年の大規模音声言語モデル(音声LLM)の進展により、1人が話す音声や少人数対話の音声認識は高精度で実現できるようになりつつあります。一方、複数の話者や話題が入り乱れ、同時発話も生じる自然な会話における性能は十分に明らかになっていませんでした。本研究では、会話音声認識における音声LLMの性能を多面的に評価するため、意味的な誤りを評価する指標や同時発話区間での誤り分析手法を定義し、会話音声認識における音声LLMの性能を多面的に評価しました。これにより、実環境の複数人会話における音声LLMの課題把握を可能にし、より高精度な会話音声認識技術の実現に貢献します。

■SphereVBx: Spherical Variational Bayes Clustering for Simplified EEND-VC Diarization
(SphereVBx:球面変分ベイズクラスタリングによる EEND-VC 話者ダイアライゼーションの簡素化)

Petr Pálka(BUT)、Jiangyu Han(BUT)、マーク デルクロア 特別研究員(CS 研)、俵 直弘 主任研究員(CS 研)、Lukáš Burget(BUT)

会議音声などの多人数会話音声認識では、音声から「誰が、いつ話したか」を推定する話者ダイアリゼーションが重要な役割を担います。一方、最先端の話者ダイアリゼーションシステムでは、高い性能を実現するために、話者特徴を識別しやすい空間へ変換したうえで話者を分類するなど、複雑な処理が必要でした。本研究では、このような複雑な処理を不要にするため、話者特徴を超球面上で直接分類する球面変分ベイズクラスタリング「SphereVBx」を提案しました。これにより、従来法と同等以上の性能を、よりシンプルな処理で実現しました。本成果は、より効率的で使いやすい多人数会話音声認識技術の実現に貢献することが期待されます。

■Multi-Talker ASR Unaffected by Speaker Change Count
(話者交代数に依存しない複数話者音声認識)

牧島 直輝 研究員(人間研)、山田 涼楓 社員(人間研)、山根 大河 研究員(人間研)、庵 愛 研究員(人間研)、田中 智大 研究主任(人間研)、鈴木 聡志 研究主任(人間研)、折橋 翔太 研究主任(人間研)、増村 亮 特別研究員(人間研)

本研究では、話者交代数に頑健な複数話者音声認識及び話者ダイアライゼーションのための自己回帰モデルを提案します。従来法では、各話者の書き起こしや発話時間などを話者交代トークンで連結した単一のトークン系列を再帰的に推定します。しかし、この手法は、話者交代トークンを含む文脈への依存が大きいため、推論時の話者交代回数が学習データ中の話者交代回数を超えると性能が低下します。提案法では、self-attention機構に話者交替トークンマスクを導入し、話者交替が何回起きたかに依存せず推論を行います。本研究は、相槌を頻繁に含む会話音声や会議などの長時間音声における音声認識や話者ダイアライゼーションへの活用が期待されています。

■Unified Audio-Visual Modeling to Recognize Which Face Spoke When and What in Scenarios with On- and Off-Screen Participants
(映像及び映像内外の参加者を含む重畳音声から誰がいつ何を話したかを推定する統一音映像モデリング)

牧島 直輝 研究員(人間研)、山田 涼楓 社員(人間研)、山根 大河 研究員(人間研)、庵 愛 研究員(人間研)、田中 智大 研究主任(人間研)、鈴木 聡志 研究主任(人間研)、折橋 翔太 研究主任(人間研)、増村 亮 特別研究員(人間研)

本研究では、話者が映っている場合と映っていない場合の両方を含む映像及び重畳音声から、どの顔がいつ何を話したかを認識する音声・映像モデリング手法を提案します。従来法では、どの顔がいつ何を話したかという情報を単一のトークン系列で表現し、自己回帰的に推論していました。しかし、この手法は、全話者が常に映像内に映っていることを前提としており、実環境で生じる話者の遮蔽やカメラ視野外の話者に対応することができません。提案法では、映像内に話者が存在しないことを示す専用トークンを導入し、カメラ視野内外の話者を含む音声と映像の組み合わせでモデルの学習を行います。本研究は、プライバシーの問題や遮蔽の問題で対象の映像が得られない場面での音と映像によるAIコミュニケーション支援への活用が期待されます。

■Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings
(多人数会話におけるターンテイキング予測能力の大規模言語モデルと人間の比較)

福田 りょう 研究員(CS 研)、叶 高朋 研究主任、Siddhant Arora(CMU)、マーク デルクロア 特別研究員(CS 研)、俵 直弘 主任研究員(CS 研)、小川 厚徳 主任研究員(CS 研)、千葉 祐弥 主任研究員(CS 研)、安藤 厚志 主任研究員(人間 研)、William Chen(CMU)、Shinji Watanabe(CMU)

会話の中で、発話の順番や話者交替のタイミングを決定する仕組みは「ターンテイキング」と呼ばれます。近年、大規模言語モデル(LLM)の対話能力が大きく向上していますが、LLMが多人数会話に参加し、人間のように自然なターンテイキングを行えるかどうかは十分に明らかになっていません。そこで本研究では、多人数会話において「今の発話が誰に向けられているのか」「次に誰が話すのか」などを予測する課題を通じて、LLMと人間のターンテイキング能力を比較しました。その結果、LLMは一部の課題で人間に匹敵する性能を示す一方、音声や視線などの情報を十分に活用できず、多人数会話に参加する上で大きな課題があることが示されました。本研究で得られた知見は、会議の司会やグループでの共同作業など、多人数会話で人間と協調するAIの実現に貢献します。

■LLM-as-Joiner: Decoupling Alignment from Language Modeling in Label-Synchronous ASR
(言語モデリングとアラインメントの分離に基づく音声認識へのLLM統合に関する研究)

Lee Jaeyoung 社員(人間研)、三村 正人 主任研究員(人間研)、河原 達也 (京都大学)、馬越 亮(京都大学)

近年、大規模言語モデル(LLM)の豊富な言語知識を音声認識に活用する研究が進んでいます。しかし従来法では、長い音声データをLLMに入力し、音声と文字の対応まで学ばせるため、処理負荷が大きくなりやすい課題がありました。本研究では、音声認識モデルが音声と文字の対応付けを担い、LLMは文脈や言葉のつながりの理解に専念する「LLM-as-Joiner」を提案しました。英語と5言語の音声データを用いた実験で、従来法より高い認識精度と処理効率を確認し、スマートフォンなど身近な機器で動く小型モデルの性能向上にもつながりました。本成果により、大規模な計算資源に頼らずに、多言語の音声をより正確に文字化できる技術の実用化が期待されます。

■Progressive Alignment Objectives for Aligner-Encoder based ASR
(階層的補助損失によるAligner-encoderの正則化)

Lee Jaeyoung 社員(人間研)、三村 正人 主任研究員(人間研)、森谷 崇史 准特別研究員(人間研)

音声認識では、音声のどの部分が文章中のどの文字や単語に対応するかを正しく捉える必要があります。Aligner-Encoderは、この対応関係をモデル内部で学習することで、比較的シンプルな構成で音声を文字に変換できます。一方、従来方式では対応関係が処理の終盤で急に形成されるため、学習が不安定になり、特に長い発話で精度が低下する課題がありました。本研究では、処理の途中でも対応関係を学習し、細かな単位から最終的な文字列へ段階的に整えるInterAlignerを提案しました。英語音声データで認識誤りを大幅に削減し、会議や講演のように長く続く発話ほど高い改善効果を確認しました。本成果により、会議の議事録作成や動画への字幕付与など、誰もが日常的に利用する音声認識サービスの精度向上が期待されます。

■Upcycling Pretrained Transformers into Mixture-of-Experts for Multilingual Speech Recognition
(事前学習済みTransformerをMixture-of-Experts化する多言語音声認識手法)

品山 健太朗 研究員(人間研)、三村 正人 主任研究員(人間研)、松浦 孝平 研究員(人間研)、Lee Jaeyoung 社員(人間研)

多言語音声認識は、1つのモデルで複数の言語の音声を認識する技術です。しかし、言語ごとに異なる発音や文字の特徴を限られたモデル容量で学習するため、言語ごとに個別のモデルを構築した場合よりも認識精度が低下することがあります。本研究では、事前学習済みモデルの内部構造を複製し、複数の専門的な処理部分を言語に応じて使い分けるMixture-of-Experts構造へ変換することで、推論時の計算量を増やさずにモデルの表現力を拡張しました。本成果は、多様な言語に対応した高精度かつ効率的な音声認識への活用が期待されます。

■Non-Autoregressive Minimum Bayes' Risk Decoding for Fast Speech Recognition
(高速な音声認識のための非自己回帰最小Bayesリスク復号)

出口祥之 ポスドク(CS研)、叶高朋 研究主任(CS研)、帖佐克己 研究員(CS研)、Marc Delcroix 特別研究員(CS研)

会議の録音音声の自動書き起こしといった長時間の音声認識では、認識精度だけでなく処理速度も重要です。これまで、音声認識モデルは大きく分けて、低速・高精度な「自己回帰型」と高速・低精度な「非自己回帰型」が提案されてきましたが、非自己回帰型の処理速度を保ちつつ自己回帰型に匹敵する精度を達成することは困難でした。本研究では、非自己回帰型モデルに対して追加学習なしで精度を改善する「最小Bayesリスク復号」という機構を組み込むことで、自己回帰型モデルと比べ、最大で、同等の精度を保ちながら43.1倍の高速化に成功しました。本成果は、会議や講演のような長い音声の高速・高精度な書き起こしといった活用が期待されます。

■How does children's pronunciation develop? Capturing syllabic change with children's growth using unsupervised syllable discovery
(子どもの発音はどのように発達するのか?教師なし音節発見を用いた成長に伴う音節変化の分析)

堀井 こはる 研究員(CS研)、俵 直弘 主任研究員(CS研)、小川 厚徳 主任研究員(CS研)、荒木 章子 主席研究員(CS研)

高精度な子ども向け音声認識器の開発や言語発達の理解の促進のためには、子どもの成長に伴う発音変化の分析が不可欠です。しかし、大人基準の発音ラベルに基づく音声認識器を用いた従来の手法では、子ども特有の発音や中間的な音を正確に捉えきれませんでした。そこで本研究では、発音ラベルを用いずに音声から音のまとまり(音節)を発見する教師なし音節発見モデルを用いた新たな子ども音声の分析手法を提案します。提案手法を用いて5~15歳の大規模な音声データを分析した結果、子どもの成長過渡期特有の発音や試行錯誤による発音の揺らぎが見られる時期を経て、その後、大人のような安定した発音に収束する過程を自動的・客観的に捉えることに成功しました。本成果は、言語発達研究に新たなデータ駆動型のアプローチを提供するとともに、成長段階に応じた高精度な子ども向け音声認識器の開発に繋がることが期待されます。

■Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction
(音声印象に基づく指示文・音声対の疑似生成データを用いた自然言語指示による音声合成手法)

藤田 健一 研究員(人間研)、井島 勇祐 特別研究員(人間研)

音声間の印象差分から自然言語による演技指示を自動生成し、大規模な指示文付き音声データを構築する手法を提案しました。さらに、このデータを活用することで、自然言語による多様な発話スタイル制御を実現する音声合成モデルを構築しました。本成果は、ユーザが与える演技指示を柔軟に反映可能な音声合成技術への応用が期待されます。

■MeanVoiceFlow2: Joint Optimization of Mean Flow and Content Encoder for Fast One-Step Zero-Shot Voice Conversion
(MeanVoiceFlow2: 高速なワンステップ未知話者声質変換のための平均フローと発話内容特徴抽出器の同時最適化)

金子 卓弘 特別研究員(CS研)、亀岡 弘和 上席特別研究員(CS研)、田中 宏 主任研究員(CS研)、近藤 祐斗 研究員(CS研)

声質変換では、高音質で本人らしい声を再現できるFlow Matchingと呼ばれる生成AI系手法が注目されています。一方で、この手法では高品質な音声を生成するために繰り返し計算が必要になることが多く、処理時間の長さが課題となっていました。私たちが以前提案したMeanVoiceFlowは、繰り返し計算を不要にすることで高速化を実現しましたが、話す内容を保つための処理が重く、さらなる高速化の妨げとなっていました。本研究では、この処理を軽量化しながら、声質変換モデルと一体的に学習する新しい手法「MeanVoiceFlow2」を提案しました。実験の結果、従来手法と同等の話者らしさを保ちながら、より自然な音質を実現し、推論速度も約9倍高速化できることを確認しました。本手法は、今後、高性能かつ高速な声質変換を実現する上で重要な技術になると期待されます。

■Latency Controllable Speech Enhancement
(遅延可変の音声強調)

佐藤 宏 研究主任(人間研)、 森谷 崇史 准特別研究員(人間研)、落合 翼 研究主任(CS研)、デルクロア マーク 特別研究員(CS研)

音声強調技術は、音声に含まれる雑音を抑え、聞き取りやすさを高める技術です。一般に、利用できる処理時間が長いほど性能は向上しますが、従来方式は一つの遅延条件に固定されていました。本研究では、利用可能な処理時間に応じて性能を高め、一つのモデルで動作時の遅延を動的に切り替えられる技術を提案しました。実験では、特定の遅延条件のみで学習した従来方式を上回る性能を確認しました。本成果により、利用するアプリケーションに応じた高品質な音声処理の実現が期待されます。

チュートリアル

■Conversational Speech Recognition and Analysis: Progress, Challenges, and Emerging Opportunities with Speech Language Model
(大規模音声言語モデル時代における会話音声認識・分析の進展と課題、そして新たな可能性)

俵 直弘 主任研究員(CS 研)、Samuele Cornell(CMU)、Alexander Polok(CMU)、森谷崇史 准特別研究員(人間研)、マーク デルクロア 特別研究員(CS 研)、Lukáš Burget(BUT)、Shinji Watanabe(CMU)

近年、大規模な音声言語モデル(Speech Language Model: SLM)の登場により、会話音声認識技術は大きな転換期を迎えています。一方で、従来技術で培われてきた知見をどのように活かしながら次世代技術へ発展させていくかは、重要な研究課題となっています。そこで、「音声言語モデル時代における会話音声認識・分析の進展と課題、そして新たな可能性」をテーマとしたチュートリアルを企画しました。本チュートリアルでは、会話音声認識・分析技術の進展を俯瞰するとともに、SLMがもたらす可能性と課題を整理し、今後の研究の方向性について議論します。

トピックスに記載している情報は、発表日時点のものです。
現時点では、発表日時点での情報と異なる場合がありますので、あらかじめご了承いただくとともに、ご注意をお願いいたします。