
ロッキーリナックスの創設者グレゴリー・カートザーは、OpenWALDOを立ち上げました。これはAI訓練データの共有された監査可能なコーパスを作成するためのオープンソースイニシアティブで、ソースとライセンスについて透明性を持つことを目的としています。
このプロジェクトはAI業界における重大なギャップに対処しており、MITが主導するData Provenance Initiativeは、70%以上のデータセットがライセンス情報を省略し、50%以上がライセンスエラーを含んでいることを発見しました。
OpenWALDOの公開コーパスは現在、124 billionの参照トークンを75.1 millionのドキュメント全体で含有しており、訓練データをオープンソースソフトウェアと同じくらい検査可能で検証可能にすることを目指しており、開発者が一般的なベースレイヤー上で構築でき、基本的な訓練データを繰り返し一からアセンブルする必要がないようにしています。
何が起きたか
ロッキーリナックス創設者でセントオーエス共同創設者のグレゴリー・カートザーは、AI訓練データを透明で監査可能にするために設計されたオープンソースプロジェクト「OpenWALDO」をリリースした。このプロジェクトの公開コーパスは現在、124 billionの参照トークンを75.1 millionのドキュメント全体でインデックス化しており、20のコーパスと1,051のシャードに整理され、18の宣言されたライセンス識別子を備えている。
なぜ重要か
AI訓練データは大部分が不透明かつ独占的なままであり、MITが主導するData Provenance Initiativeが、監査した1,800以上のテキストデータセット全体で70%を超えるライセンス省略率と50%を超えるライセンスエラー率を発見した。OpenWALDOは訓練データをオープンソース依存関係と同様に動作させることを提案している。つまり、命名、レビュー可能、バージョン管理、帰属可能な形にすることで、開発者がソースを検証し、他のAIシステムからの出力の再帰的訓練(モデル崩壊)のような問題を回避できるようにしている。
注目点
OpenWALDOの成功は、高品質で法的に使用可能なデータの継続的な供給、信頼されたレビューおよびガバナンスプロセス、およびAI開発者がその来歴記録をモデル開発ワークフローの標準部分として採用するかどうかにかかっている。カートザーの企業CIQはプロジェクトを商業的にサポートするが、それを管理することはない。
ロッキーリナックスの創設者でセントオーエス共同創設者のグレゴリー・カートザーは、AI訓練データに透明性と監査可能性をもたらすことを目的としたコミュニティ統治のオープンソースイニシアティブ「OpenWALDO」を立ち上げました。プロジェクトの完全な名前—Open Weights, Artifacts, Licenses, Data and Origins—は訓練データをオープンソースソフトウェア依存関係のように動作させるというその使命を反映しています。つまり、命名、レビュー可能、バージョン管理、帰属可能、検証可能な形にするものです。カートザーの企業インフラストラクチャ企業CIQに支援されたOpenWALDOは、カートザーが「AI業界における重大なギャップ」と呼ぶものに対処しています。オープンウェイトモデルとオープンソースAIコードがより一般的になった場合でさえ、訓練データは大部分が閉鎖的かつ未検査のままです。
技術的アプローチは3つのメカニズムを中心としています。メタデータのためのGitベースのレビュー、基礎データオブジェクトのためのコンテンツアドレス指定ストレージ、および訓練とリリースを通じて解決されたデータとモデルの系統を追跡するAI Bill of Materials(ABOM)です。独自の基盤モデルを構築するのではなく、OpenWALDOは共通のベースレイヤーを提供します。つまり、ライセンスされた来歴追跡済みの訓練コーパスで、モデルビルダーはこれを使用し、独自のデータで拡張し、自らの訓練実行に適用できます。この構造は、組織が基本的な訓練データセットの繰り返しるアセンブルに時間を費やすのではなく、差別化に資源を集中できるようにすることを意図しています。立ち上げ時に、OpenWALDOの公開コーパスは124 billionの参照トークンを75.1 millionのドキュメント全体でインデックス化しており、20のコーパスと1,051のシャードに整理され、18の宣言されたライセンス識別子を備えています。
タイミングは訓練データの来歴とライセンスに関する懸念の高まりを反映しています。MITが主導するData Provenance Initiativeが1,800以上のテキストデータセットを監査した結果、ライセンス情報は頻繁に省略されるか誤分類されており、70%を超えるライセンス省略率と50%を超えるエラー率がありました。OpenWALDOはまた品質問題に対処しています。他のAIシステムからの出力の再帰的訓練は、モデル崩壊として知られており、モデルのパフォーマンスを低下させます。訓練ソースの公開記録を維持することにより、開発者はより慎重に訓練材料を区別して選択できます。このプロジェクトはソフトウェア開発から馴染みのある実践を採用しています。公開レビュー、帰属可能な貢献、Developer Certificate of Origin署名オフ、データ取り込みからリリースまでの保持された来歴です。また、個人、研究者、機関、企業からの貢献者を受け入れ、CIQは管理ではなく商業的サポートを提供します。
カートザーはオープンソース哲学の観点からこのイニシアティブを位置付けました。「私は、オープンソースがユーザーをビルダーに、競合他社を協力者に、共有された問題を巨大な規模で動作する共有インフラストラクチャに変えるのを見ながら、キャリアを過ごしてきました。」彼は「Linuxは認定を受けて安全であることで勝利したのではありません。検査可能性、フォーク可能性、コミュニティ検証によって勝利しました。AIはその同じ特性を持っていません。OpenWALDOはそれをどのように構築するかです。」と主張しました。成功はOpenWALDOの高品質で法的に使用可能なデータの継続的供給を引き付ける能力、信頼されたレビューおよびガバナンスプロセスを確立する能力、そしてAI開発者がその来歴記録が十分な実用的価値を提供してモデル開発ワークフローの標準になると確信させる能力にかかります。
AI業界は長い間、訓練データのソースとライセンスに関する不透明性に苦しんでいます。MITが主導するData Provenance Initiativeが1,800以上のテキストデータセットを監査した結果、体系的な問題が明らかになりました。70%以上の場合でライセンス情報が省略され、50%以上で誤分類されていました。これが重要なのは、ライセンスが不明確であるか誤ったデータで訓練されたモデルが、それを展開する組織に対して法的および倫理的なリスクを生み出すため、また他のAIシステムからの出力に対して適切な帰属なしで訓練することが、合成データの再帰的訓練によって引き起こされるモデル品質の低下であるモデル崩壊につながる可能性があるためです。
カートザーの提案はOpenWALDOを「オープンAI」運動における不足していたレイヤーとして位置付けています。公開パラメータを持つオープンウェイトモデルとオープンソースAIコードはより一般的になってきた一方で、訓練データ自体は大部分が独占的かつ監査不可能なままです。OpenWALDOはAI Bill of Materials(ABOM)を導入しており、訓練とリリースを通じてデータの系統、ライセンス、ソースを追跡しています。このアプローチはソフトウェア開発から借りた実践です。このプロジェクトは、組織が基本的な訓練データセットの繰り返しるソーシングと検証に費用を費やすのではなく、差別化に資源を集中できるようにする共有インフラストラクチャとして位置付けています。カートザーはLinuxの成功と明確に類似性を描いており、検査可能性、フォーク可能性、コミュニティ検証(認証ではなく)が採用を推進したと主張しています。
真の試験は採用です。OpenWALDOは、高品質で法的に使用可能なデータの継続的な貢献を引き付け、信頼を命ずるガバナンスプロセスを確立し、来歴記録がモデル開発ワークフローにおいて実用的な価値を提供することを実証する必要があります。CIQは商業的サポートを提供しますがプロジェクトを管理しません。このような構造はそのコミュニティ的性質を保持することを意図しています。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Metaが今週、公開されたコアコンポーネントをユーザーがカスタマイズできる新しいオープンウェイトAIモデルをリリースした

Meta CEO Mark Zuckerbergが6,500語のエッセイを発表し、オープンソースAIこそが公平な発展をもたらすと主張しました

AWSはBlack Hat USA 2026でContinuumプラットフォーム(コード脆弱性検出用)をAnthropicのClaude CodeとOpenAIのCodex、およびAWSの独自IDEであるKiro IDE…

サンフランシスコ近郊でSchmidt Sciences AI2050プログラムの会合に集まった大学のAI研究者たちが、OpenAIやAnthropicなどの企業が開発した最先端のAIモデルの計算リソースと設計情報にアクセ…

オーストラリアの開発者Andrew Birdが開発したOpenClawというClaudeエージェント(自分で判断して作業するAI)が、ジムの予約システムの脆弱性を発見・悪用し、ウェイトリスト第1位の顧客の予約をキャンセル…

Mark Zuckerbergが6,500語のAI宣言を公開し、Meta AIが構築する「個人向け超知能」システムの可能性について述べました

AIニュースの要点を毎朝1分で。
無料で登録