検索パネルを開く 検索パネルを閉じる メニューを開く メニューを閉じる

2026年10月 7日

お知らせ

マルチモーダルAIと人間・社会のインタラクション領域における難関国際会議ICMI2026にNTTから3件の論文採択

2026年10月5日~10月9日にイタリア・ナポリにて開催される、マルチモーダルインタラクション分野のトップ国際会議 The 28th ACM International Conference on Multimodal Interaction(ICMI 2026)に、NTT研究所から3件の論文が本会議に採択されました。

ICMIは、音声、言語、表情、視線、身体動作など、人と人、人とAI・ロボットとのコミュニケーションに関わる複数の情報(モダリティ)を統合的に扱う「マルチモーダルインタラクション」に関する主要な国際会議です。ICMI 2026では、マルチモーダル情報を用いた対話理解や、人と自然にインタラクションするAI・ロボットの実現に向けた技術など、最先端の研究成果が発表されます。

なお、所属としてそれぞれ略称で記載されている研究所名は以下の通りです。(所属は投稿時点)
人間研:人間情報研究所

■Self-Distillation as a Structure-Dependent Mechanism in Multimodal Dialogue via Multi-Context Modeling
(マルチコンテキストモデリングによるマルチモーダル対話における構造依存型自己蒸留)

石井 亮(特別研究員)(人間研)、高山 千尋(主任研究員)(人間研)、長尾 慈郎(主任研究員)(人間研)、大西 俊輝(社員)(人間研)、中野 有紀子(成蹊大学)、澤瀬 順一(主幹研究員)(人間研)

複数人の対話をAIが理解するためには、発話内容だけでなく、声や表情などの情報に加え、参加者同士のやり取りや個々の参加者のコミュニケーション行動を捉えることが重要です。本研究では、対話全体の相互作用と、個々の参加者の振る舞いを分けて捉えるマルチコンテキストモデルを提案しました。さらに、モデル自身の予測を学習に活用する「自己蒸留」の効果が、対話情報の表現構造に依存することを明らかにし、両者を適切に組み合わせることで高い対話理解性能を実現しました。

■Causal Temporal Padding for Low-Latency Real-Time Gesture Generation
(因果的時間パディングによる低遅延リアルタイムジェスチャ生成)

石井 亮(特別研究員)(人間研)、永徳 真一郎(主任研究員)(人間研)、長尾 慈郎(主任研究員)(人間研)、澤瀬 順一(主幹研究員)(人間研)

人と対話するAIエージェントやロボットでは、発話に合わせた身体動作を遅延なく生成することが重要です。本研究では、従来のジェスチャ生成モデルが、内部処理で暗黙的に未来の情報を必要とすることが遅延の一因であることを明らかにしました。そこで、過去と現在の情報だけから逐次的にジェスチャを生成できる手法を提案し、動作の品質を維持しながら処理遅延を大幅に削減するとともに、ユーザが感じる応答性を向上できることを確認しました。

上記の他1件の論文が採択されました。

トピックスに記載している情報は、発表日時点のものです。
現時点では、発表日時点での情報と異なる場合がありますので、あらかじめご了承いただくとともに、ご注意をお願いいたします。