この記事で分かること
Wispr Flowはどんな企業か
AI音声入力ツール「Flow」を展開する米スタートアップです。話すだけであらゆるアプリにテキスト入力でき、高いノイズ耐性、言い淀みの除去や修正文脈の自動整形機能により、キーボード不要の高速入力を実現しています。
どのように耐ノイズ性を向上したのか
深層学習による雑音分離と騒音下で訓練した自社モデル「Canto」を活用。さらにLLMが前後文脈や画面情報を踏まえて途切れや誤認識を自動補正することで、過酷な環境下でも高い認識精度を達成しています。
評価が高まっている理由は何か
Fortune 500企業の過半数への導入実績、70%という高い顧客定着率、独自モデルによる差別化に加え、会議要約やデバイス連携へと広がる「音声AIインフラ」としての高い将来性が評価されています。
Wispr Flowの評価額増加
AIスタートアップのWispr Flow(ウィスパー・フロー)がシリーズBラウンドで2億8,000万ドルの資金調達を実施し、企業評価額が20億ドル(約9カ月で約3倍)に達しました。累計調達額は3億6,100万ドルにのぼります。
音声でテキストを入力・操作するAIプロダクト「Flow」を展開し、高い評価を受けています。
Wispr Flowはどんな企業か
Wispr AI(Wispr Flow)は、2021年にサンフランシスコで設立された、AIを活用した次世代音声ディクテーション(音声入力)プラットフォームを開発する米国のスタートアップ企業です。キーボード入力を音声へと置き換え、デジタル上のコミュニケーションや情報入力を高速化・効率化することを目指しています。
企業概要と創業背景
- 創業者: タナイ・コタリ(Tanay Kothari / CEO)およびサハジ・ガルグ(Sahaj Garg / CTO)
- 事業の変遷: 創業当初は口の動きや神経信号から無音でテキストを入力するウェアラブル端末(ハードウェア)の開発を進めていました。その後、内部用に構築していた音声AIソフトウェアの精度と応答性の高さに着目し、汎用音声入力ツール「Flow」へと事業をピボットしました。
主力プロダクト「Flow」の強みと機能
- 横断的なクロスプラットフォーム対応: macOS、Windows、iOS、Androidに対応し、システム入力欄に直接統合されます。メール、Slack、ブラウザ、各種ドキュメントなどアプリを問わず話すだけで入力可能です。
- スマートフォーマットと自動言い直し補正:言い淀み(フィラー)を自動除去するだけでなく、話の途中での修正(例:「5時に集合、やっぱり6時に変更で」→「6時に集合」)をAIが文脈を汲んで正しく整形します。
- 高い耐ノイズ性能: バックグラウンドの騒音、風切り音、BGM、話者の強いアクセントなど、従来の音声認識が苦手とする過酷な環境下においても、単語の誤認識率(WER)を従来の30%超から5〜10%へ大幅に低減。
- 音声による編集と外部AI連携: 音声指示で文章のスタイル変更や翻訳ができる「コマンドモード」を搭載するほか、Perplexityなどの検索エンジンと直接連携した音声リサーチも行えます。
- 多言語・独自辞書: 日本語を含む100以上の言語に対応し、固有名詞や専門用語を登録できるカスタム辞書、チーム向けの定型文スニペット機能も提供されています。
- 厳格なセキュリティ: データ保持を制限するプライバシーモードを備え、SOC 2 Type IIやHIPAAなどのエンタープライズ基準を満たしています。

Wispr Flowは、AI音声入力ツール「Flow」を開発する米スタートアップです。高い耐ノイズ性能と自動文章補正に強みを持ち、アプリを問わずキーボード不要の高速入力を実現。評価額20億ドルへ急成長しています。
どのように耐ノイズ性を向上したのか
Wispr Flowは、音声信号処理(DSP)による物理的なノイズ除去と、大言語モデル(LLM)による文脈復元を組み合わせた多層的なAIパイプラインによって耐ノイズ性を向上させています。
- リアルタイムノイズキャンセリング(音源分離): マイクに入力された音声から、キーボードの打鍵音、オフィスやカフェの環境音、風切り音、BGMなどの背景ノイズを深層学習(Deep Learning)フィルターで高度に分離・カットします。
- 過酷な環境データを網羅した音響モデル学習:単に綺麗な音声だけでなく、騒音下やマイク距離が不安定な状態、多様なアクセントを含む大規模な現実世界データで音声認識(ASR)モデルを訓練することで、雑音混じりの音素パターンに対する識別力を強化しています。
- LLMによる文脈予測とエラー復元: 雑音で音声が一瞬途切れたり誤認識されたりした場合でも、後段の言語モデルが前後の文章構造や意味を理解し、人間が本来言おうとした自然な言葉へと自動補正(復元)します。
- 画面文脈(Context-aware)の活用:使用しているアプリ(Slackやメール、ドキュメントなど)や画面上のテキスト情報、登録されたカスタム辞書を認識エンジンに反映させることで、背景の雑音や他人の話し声を自発的な発話と誤認するのを防いでいます。

深層学習フィルターによる雑音分離と、騒音データで訓練した音声認識モデルを結合。さらにLLMが前後文脈や画面情報を踏まえて途切れや誤認識を自動補正することで、過酷な環境下でも高い認識精度を実現しています。
評価が高まっている理由は何か
Wispr Flowの評価(評価額および市場での人気)が急上昇している理由は、単なる便利な音声入力アプリにとどまらない圧倒的な企業導入実績、驚異的な顧客定着率、独自技術による参入障壁、プラットフォーム化への事業拡張性の4点に集約されます。
1. 爆発的なエンタープライズ導入と成長スピード
- 大企業での導入拡大:NvidiaやAmazonをはじめとするFortune 500企業の過半数(270社以上)、10,000社以上の企業・組織へ急速に浸透しています。
- ハイパーグロース: 前年比100倍のユーザー成長や月次(MoM)約40%の拡大を継続しており、プラットフォーム上で生成された累計文字数は600億ワードを突破しています。
2. 異例の「高い顧客定着率(リテンション)」
- 生産性ソフトウェアとしては異例となる12カ月リテンション率 70%を記録しています。
- 一時的な試用にとどまらず、「タイピングを音声へ完全に置き換える日常のワークフロー習慣」としてユーザーに定着している点が、投資家から極めて高く評価されています。
3. 独自モデル「Canto」による技術的参入障壁
- OpenAIやGoogleなどの既存モデルへの依存から脱却し、自社開発の音声認識モデル「Canto」を投入。
- 騒音下での単語誤認識率(WER)を30%超から5〜10%へと大幅カットし、技術面で他社プロダクトとの明確な差別化を確立しました。
4. 「単なるディクテーション」を超えたプラットフォーム化
- 会議AI(議事録要約)領域への参入: 単なるテキスト入力だけでなく、会議の自動要約やアクションアイテム抽出機能を統合し、Granola等の会議支援ツール領域へ進出しています。
- APIおよびハードウェア連携: スマートリング(Oasis ring)などウェアラブル端末との連携や、他社アプリに音声認識機能を組み込めるB2B APIの提供を開始し、「全デバイス対応の音声AIインフラ」への進化を見せています。

大企業への導入急増と70%という高い顧客定着率、自社モデルによる高い耐ノイズ性能、そして会議要約やデバイス連携へ広がる「音声AIインフラ」としての高い成長性が評価されているためです。

コメント