AIToday
オープンソースAIHacker News掲載日時: 2026年6月14日 4:001分で読める

2016年に録音したポッドキャストの音声を、オープンソースAIを使って自分のノートパソコンで文字起こしできるようになった——2016年当時は有料クラウドサービスしかなかった作業が、いまは無料で完全にローカルで実行できる。

LINEで送る
2016年に録音したポッドキャストの音声を、オープンソースAIを使って自分のノートパソコンで文字起こしできるようになった——2016年当時は有料クラウドサービスしかなかった作業が、いまは無料で完全にローカルで実行できる。

3つのポイント

  1. 何が起きたか

    あるエンジニアが、2016~2017年に収録した10エピソード(約10時間)のポッドキャスト音声を、WhisperX(音声認識)とpyannote.audio(話者識別)という2つのオープンソースモデルを使い、Apple Silicon搭載のノートパソコンでローカル処理して文字起こしと話者ラベリングを完了しました。音声はクラウドに送らず、外部APIの課金もなし。

  2. なぜ重要か

    2016年当時、このレベルの音声処理は有料クラウドサービスが必須で個人には手が出せない領域でした。それが現在はオープンソースモデルの進化により、1台のノートパソコンで夜間に処理できるようになった。数年間アクセスされていなかった過去のコンテンツが検索可能・閲覧可能な状態に生まれ変わり、追加コストなしに第二の生を得られたとみられます。

  3. 注目点

    全10エピソード分の処理に約14時間の計算時間がかかり、おおよそ実時間の2倍のペースでした。1エピソード当たり1時間47分~2時間7分の処理時間。ホストの名前の自動修正やマージ処理など簡単な後処理を加えると、各エピソードページに話者別の会話文字起こしと再生タイムスタンプ付きで掲載できます。

この記事についてAIに質問する →

LINEで送る

「オープンソースAI」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • DataAgentが1000万ドル調達、Kubernetes障害を自動修復SiliconANGLE AI · 4時間前
  • Z.aiが国産チップ10万基でGLM稼働DIGITIMES Asia · 7時間前
  • Broadcom発表 VMware AI Factory で高速なプライベートAITop Companies AI · 16時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へTsinghua大学の研究チームが開発した「Count Anything」は、群衆の人数から医療画像の細胞まで、あらゆる種類の物体を数えられる汎用AIモデルで、これまで個別システムが必要だった課題を一つのモデルで解決します。