AIToday
大規模言語モデルオープンソースAIHugging Face Blog掲載日時: 2026年8月27日 1:013分で読める

Sentence Transformers v6.0、MultiVectorEncoder訓練に対応

LINEで送る
Sentence Transformers v6.0、MultiVectorEncoder訓練に対応

要点

Sentence Transformersがマルチベクトル検索モデルの学習に対応。

3つのポイント

  1. 何が起きたか

    Sentence Transformers v6.0が4つ目のモデルタイプ「MultiVectorEncoder」を追加し、ColBERT方式の後期相互作用検索に対応。このマルチベクトルモデルのファインチューニングが可能になり、新規のゼロからの学習にも対応する。

  2. なぜ重要か

    ドメイン固有のデータでマルチベクトルモデルをファインチューニングすると、検索精度が大幅に向上する。941トークンからなる医療評価データでは、多くの事前学習モデルの切り詰め処理により、NDCG@10で最大0.24の損失が発生する。また、「-unsupervised」チェックポイントは完成済みのモデルより適応性が高いため、事前教師あり学習済みのチェックポイントから始めるのが推奨される。日本国内の医療情報検索システムを開発する企業は、自社データでの調整により検索精度向上を図れる可能性がある。

  3. 注目点

    単一のRTX 3090で14.5時間かけて学習したファインチューニング済みモデル(multi-vector-encoder/mLateOn-medical)は、医療評価で汎用検索モデルすべてを上回る性能を示した。訓練パイプラインは「pip install -U "sentence-transformers[train]"」で試せる。

この記事についてAIに質問する →

背景と解説

今回のアップデートは、検索分野でよくある問題に対処している。多くの公開モデルは長い文書を切り詰めて処理するため、平均941トークンの医療文書ではNDCG@10で最大0.24の損失が生じる。自前のマルチベクトルモデルを学習すれば、データに必要な文書長を設定でき、この静かな損失を回避できる。 著者の実験では、汎用検索でファインチューニングされていない「-unsupervised」チェックポイントが、完成済みモデルより新しいドメインへの適応に優れていることが示された。後期相互作用の構造を保持しつつ、ドメイン学習が打ち消す必要のある汎用チューニングを経ていないためだ。gte-modernbert-baseのような強力なバックボーンへの新規プロジェクションでも既存チェックポイントにほぼ匹敵し、有力な代替策となる。 実用的には、チームが単一GPUで数時間以内にドメイン特化型検索モデルを構築できるようになり、大規模なリソースは不要になる。提供されたトレーニングパイプラインで手順が簡素化され、控えめな学習でも特定ドメインで汎用検索モデルをすべて上回れることが評価で実証されている。

よくある質問

マルチベクトルモデルとは?
文書全体を1つのベクトルに圧縮するのではなく、トークンごとに小さなベクトルを保持するモデル。各クエリトークンを最も関連する文書トークンと照合してスコアリングする。
学習にはどのくらい時間がかかる?
例として示されたファインチューニングモデルは、単一のRTX 3090で14.5時間かけて学習された。
既存のチェックポイントか、新規のプロジェクションから始めるべき?
利用可能なら、事前教師あり学習済みの「-unsupervised」チェックポイントから始めるのがよい。完成済みモデルより適応性が高いため。強力な検索事前学習済みバックボーンへの新規プロジェクションもほぼ同等の性能で、次善の策となる。
Hugging Face Blog元記事を読む

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

カリフォルニア工科大教授が民生用GPUで気象AIを公開

カリフォルニア工科大学のアニマ・アナンドクマー教授は、民生用GPUを使い、1年足らずで従来の物理シミュレーションに対抗するオープンソースのAI気象モデル「FourCastNet」を開発した

NEWLatent Space1時間前

Particleがポッドキャスト検索エンジン「Radar」発表

元Twitterエンジニアらが創業したAIニュースリーダー企業Particleが、ポッドキャスト検索エンジン「Radar」を発表した

NEWTechCrunch AI1時間前

謎のAIモデルOx Alphaの正体はZ.ai製

GLMシリーズを手がけるZ.aiは、OpenRouter上で匿名公開されたモデル「Ox Alpha」がGLMシリーズの最新版であると認めた

NEWTechCrunch AI1時間前

Glean、デスクトップ型Tau発表、低コスト主張

Glean Technologies Inc.は本日、企業向けAIをローカルファイルやアプリ、コードに接続するデスクトップワークスペース「Glean Tau」を発表した

NEWSiliconANGLE AI4時間前

IBMがGranite 4.2発表、Apache 2.0で展開

IBMは言語モデル「Granite 4.2」を3B、8B、30Bの3サイズで公開した

NEWTHE DECODER4時間前

Moonshot AI、米クラウド大手とKimi K3提供交渉

中国のAI新興企業Moonshot AIが、Kimi K3モデルをAzure、AWS、Google Cloudで提供するため、マイクロソフト、アマゾン、グーグルと収益分配契約を交渉中

NEWTHE DECODER4時間前
次の記事へParticleがポッドキャスト検索エンジン「Radar」発表