モデル

AlibabaがQwen3.8-LiveTranslate-Flash-Realtimeを発表、リアルタイム同時通訳の遅延を大幅短縮

2026-09-17 · LOW · AI NEWS 編集部

何が起きた

Alibabaは、マルチリンガル対応のリアルタイム音声・動画同時通訳モデル「Qwen3.8-LiveTranslate-Flash-Realtime」を発表した。音声と画像の入力に対応し、テキストと音声を出力する。60言語の音声認識と29言語の音声出力が可能で、前モデルのQwen3.5からエンドツーエンドの遅延が約2.3秒に短縮された。話者分離や音声認識(ASR)もデフォルトで有効化されている。

3行まとめ

  1. 遅延約2.3秒
  2. 60言語認識対応
  3. WebSocketで接続

なぜ重要

リアルタイム同時通訳モデルは、グローバルなコミュニケーションやオンライン会議の利便性を大きく向上させる基盤技術です。従来のモデルでは翻訳に数秒以上の遅延や高い計算コストがかかる課題がありましたが、今回のモデルは音声と画像の入力に加え、話者分離や音声認識を標準搭載し、WebSocket経由で容易に統合できる点が特徴です。これにより、国際的なビジネスや配信サービスでの活用ハードルが下がります。Alibabaは、マルチリンガル対応のリアルタイム音声・動画同時通訳モデル「Qwen3.8-LiveTranslate-Flash-Realtime」を発表した。音声と画像の入力に対応し、テキストと音声を出力する。60言語の音声認識と29言語の音声出力が可能で、前モデルのQwen3.5からエンドツーエンドの遅延が約2.3秒に短縮された。話者分離や音声認識(ASR)もデフォルトで有効化されている。。遅延約2.3秒。60言語認識対応。WebSocketで接続。WebSocket Realtime APIを活用した実際のアプリケーションでの性能検証。対応言語のさらなる拡充や音声出力の品質向上に関する続報。出典に書かれた範囲で、料金・提供条件・利用計画への影響を確認する。

影響

対象方向確信度時間軸根拠反証
リアルタイム翻訳サービス市場 中期 エンドツーエンドの遅延が約2.3秒まで短縮され、60言語認識や話者分離が標準搭載されたため。 競合他社がより低遅延かつ高精度なAPIを無償で提供しシェアを奪うこと。

今後の注目

情報源

AI NEWS 編集部

本文はAI下書きであり、事実は出典に依存する。