AIToday

テック業界がOpenAIを支持、データ課題残る

Hacker News5時間前LINEで送る
テック業界がOpenAIを支持、データ課題残る

要点

Jensen Huangとほぼ全ての主要米国テック企業が、国家利益とイノベーション利益を根拠にオープンソースAI開発を支持する書簡に署名した。ただし著者は、オープンモデルが独占的モデルと真に競争するためには、閉鎖モデルが訓練に用いた著作物(書籍、論文、コード、動画)への公正使用アクセスを米国がオープンソース開発者に保証すべきであり、これは知的財産法の根本的な見直しを要すると主張している。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Jensen HuangとAnthropicを除くテック業界全域のCEOらが金曜日、米国のオープンソース人工知能への投資を支持する書簡に署名し、トランプ政権によるオープンソースソフトウェアの保護主義的制限の動きに対抗した。

  • なぜ重要か

    オープンソースAIモデルは中国との経済競争で競争環境を平準化し、共有研究とベンチマークを通じてイノベーションを加速できる。ただし書簡は最難関課題に触れていない。つまり、オープンモデルが独占的モデルと同じ訓練用データ(書籍、論文、コード、動画)への公正使用アクセスを得ることであり、これには著作権と知的財産法の根本的見直しが必要となる。

  • 注目点

    著者は真に競争力を持つオープンソースモデルに3つの要素(人員、計算リソース、データ)が必要と主張し、DeepSeekやMoonshotなどの中国企業が1000万ドル以下で訓練可能と実証した点から、データアクセスが解決されればテック企業間の計算リソース共有契約が実現可能だと示唆している。

詳細

金曜日、Jensen HuangはTwitterで短い書簡を公開し、オープンソース人工知能を中心とした「強力でオープンなエコシステム」への米国投資を呼びかけた。Huangはオープンソースが「複数世代の米国のエンジニアと起業家が機関的主権を構築した知識の共有基盤を作り出した」と主張し、オープンソースAIの採用から同様の利益が得られると予測した。書簡は暗黙の政治的重要性を持っていた。トランプ政権は中国の言語モデルを抑圧する保護主義的施策としてオープンソースソフトウェアを禁止することを示唆していたが、これはAnthropicとOpenAIにオープン競争相手を排除させることで利するものだった。これを認識して、Anthropicを除く業界全域の主要および小規模企業のCEOらが金曜日にHuangの書簡に素早く署名した。

本稿著者はこの展開を祝うが、Huangが最も困難で重要な部分を抜かしたと主張する。競争力のある言語モデルの構築には3つの入力が必要である。人員、計算リソース、データである。人員に関して、著者は富の約束がオープンソース活動から人材をそらしてきたが、業界の支援が今やリクルートメントを安定させるべきだと指摘する。計算リソースに関して、著者は超大規模データセンターが乗り越え難い障壁であるというナレーティブに異議を唱える。DeepSeekとMoonshotなどの中国企業は競争力のあるモデルを1000万ドル以下で訓練したと報告されており、オープンソース開発はテック企業間の計算リソース共有契約を通じて支援でき、これは各企業の予算の極微小な割合にしかならない。著者は一度モデルがオープンに構築されれば、効率は自然に従うと予測する。「機械学習は摩擦のない再現性を通じてイノベーションする分野である」とし、公開されている研究、コード、データが競争的ベンチマークを通じて迅速にシステムを改善すると述べる。著者はImageNetの高品質モデルの例を引き合いに出す。それはGoogleだけで訓練可能だったものが1年以内にデスクトップで構築可能になった。

困難な部分はデータであると著者は主張する。独占的AI企業は大規模言語モデルを膨大な著作権保護材で訓練してきた。海賊版の書籍や学術論文のライブラリ、著作権保護画像、Wikipediaのような協力的知識ベース、Redditのようなボランティアフォーラム、GitHub上の全公開コード、YouTubeに投稿された全動画のトランスクリプト。これらの企業は裁判所で責任を認められ、発表された論文でこの慣行を認めており、訓練が変容的であるため公正使用に該当すると主張している。著者はこの法的推論を受け入れるが、それは両方向に切ると主張する。著作権保護材での閉鎖モデル訓練が公正使用なら、独占的モデル出力のオープンソース蒸留も公正使用であるべきであり、オープンソースモデルは同じ訓練コーパスへの同等の公正使用アクセスを持つべきである。この「オープン・コーパス」は知的財産法および著作権の根本的見直しを要するが、著者は競争的同等性のために本質的だと枠付ける。著者は課題は大きい(人材リクルート、計算協力の確保、著作権法改革)が克服可能であり、テック業界の支援と、独占的2020年代以前のオープンソース優位の簡潔な歴史が、「ものを再びオープンにする」この瞬間を作ると結論付ける。

背景と解説

金曜日のJensen Huangの書簡は大きな転換を示している。トランプ政権のオープンソースソフトウェアに対する保護主義的姿勢は、予期に反してAnthropicただ1社を除く業界全体をオープンAI支持で統一させた。これは中国のAI競争力への地政学的不安と、開放性そのものがイノベーションを駆動するという認識の両方を示している。著者はこの勢いを支持するが、不完全だと主張する。書簡はオープンウェイトとオープンソースに対応しているが、データ問題を回避している。独占的AI研究所は書籍、学術論文、コードリポジトリ、動画といった膨大な著作権保護材を、明示的許可なしに訓練に用いており、変容的公正使用を法的根拠としている。一方、オープンソース開発者はこれらのデータセットへの同等のアクセスを欠いており、公正な競争を妨げる非対称性を生じさせている。著者はこれを道徳的かつ戦略的問題として枠付けする。閉鎖モデルが訓練のために海賊版および著作権保護材を合法的に使用できるなら、国家的技術主権を中国に対して守るために、なぜオープンモデルが同じ公正使用権を持たないのか。著者は3つの困難な課題(民間AI企業から人材をリクルートすること、産業協力を通じて計算インフラを確保すること、著作権法の抜本的改革)を認めるが、業界コンセンサスと過去数十年のオープンソース・イノベーションの先例があれば全て克服可能だと主張する。

よくある質問

Jensen Huangの書簡は何と述べたのか?
HuangはTwitterで米国によるオープンソース人工知能を中心とした「強力でオープンなエコシステム」への投資を呼びかけ、オープンソースが「複数世代の米国のエンジニアと起業家が機関的主権を構築した知識の共有基盤を作り出した」と主張し、同じことがオープンソースAIで起こると予測した。
なぜ全てのテックCEOがこんなに素早く署名したのか?
トランプ政権は中国語言語モデルを抑圧する保護主義的施策としてオープンソースソフトウェアを禁止することを示唆していた。CEOらはそのような禁止がAnthropicとOpenAIのみを利するとわかったため署名した。
著者は何が依然不足していると述べているのか?
著者は、オープンソースモデルが独占的モデルが用いた訓練用データ(著作権侵害された書籍、学術論文、著作権保護画像、Wikipedia、Reddit、GitHubのコード、YouTubeトランスクリプト)への公正使用アクセスを必要とし、これを「オープン・コーパス」と呼んで、知的財産および著作権法の根本的見直しが必要だと主張している。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます