買い手ネットワーク
データ販売の
相手は、AI企業。
FileYieldは非公開型のデータ仲介サービスです。価値あるデータを保有する企業と、学習のためにそのデータを必要とするAI開発企業をつなぎます。一般公開の掲載も、入札合戦も、悪質な業者もありません。データの価値を知る人間が仲介する、直接かつ非公開の取引だけです。
仕組み
私たちが仲介するのは、
AI企業が
見つけられない取引。
お持ちのデータを伝える
普段の言葉で。技術的な準備は不要。買い手があなたのデータに何を求めているかは、私たちが見極めます。
準備状況とリスクを整理する
形式、来歴、個人情報(PII)の有無、許諾される用途、公開されている類似取引を記載します。
掲載するか、紹介を受ける
元のデータを開示せずに、承認済みのマーケットプレイス掲載か、ターゲットを絞ったアウトリーチかを選べます。
直接交渉する
価格、サンプル、ライセンス、保護措置について買い手と話し合います。時期や結果はケースによって異なります。
市場インテリジェンス
AI学習用
データ市場 2026.
AI企業は、オープンなWebのスクレイピングから、ライセンスされた学習データに数億ドル規模の資金を投じる段階へと移りました。市場は現実のもので、巨大で、誰の予想よりも速く加速しています。
$3.9B
2026年の市場規模
Grand View Research
$16.3B
2033年の予測
22.6% CAGR
$1.5T
2025年のAI支出総額
Gartner
$320B
ビッグテックのAI設備投資 2025年
MSFT + GOOG + AMZN + META
市場がいま急拡大している理由
Grand View Researchによると、AI学習用データセットの市場は2025年に$3.2Bに達し、2026年末には$3.9Bに達すると予測されています。年平均成長率は22.6%で、2033年には$16.3Bと、4倍以上に拡大する見込みです。
とはいえ、データセットのライセンス市場は全体のほんの一部にすぎません。Gartnerによると、2025年の世界のAI支出総額は$1.5Tに達し、2026年には$2Tを超える見通しです。大手テック4社(Microsoft、Alphabet、Amazon、Meta)だけでも、2025年にAIインフラと技術へ合計$320Bを投じました。2024年の$230Bから増加しています。
Microsoftは、AI対応データセンターの拡張に約$120Bを充てました。Amazonは$100B〜$120Bを投じ、CEOのAndy Jassyは「その大部分」がAIインフラに向かうと述べています。Alphabetは、サーバー、データセンター、ネットワークに約$85Bを配分しました。Anthropicは、コンピュート契約やエネルギーを含むAIインフラに約$50Bを投じる計画を発表しています。
資金の行き先
2025年、AIの主戦場はフロンティアモデルからインフラへと移りました。データ、クラウド、ガバナンスの分野で33件以上の買収が行われ、その総額は$157Bを超えました。Metaは、重要なデータラベリングとモデル評価のパイプラインを担うScale AIの株式約49%を取得し、AIスタックの重要な層である高品質な学習データへの支配力を強めました。
理由はシンプルです。モデルの性能はデータで決まります。主要なAI開発企業はいずれも、自由に使えるインターネット上のテキストを使い尽くしました。Webはすでに取り尽くされています。残っているのは、企業の内部にある独自の、専門的で分野特化のデータです。AI開発企業は、そこにアクセスするために相当な上乗せを支払うでしょう。
世界市場では、北米が34.8%のシェアを占めています。画像・動画データの分野は市場の41.9%を占め、コンピュータビジョンとマルチモーダルAIへの需要の急増がそれを押し上げています。ヘルスケアAI市場は、最も急成長している分野のひとつです(Rock Health:2025年上半期、AIはデジタルヘルス分野のVC投資の62%を獲得)。BFSI(銀行・金融サービス・保険)はエンドユーザー別シェアの7.6%を占め、成長が加速しています。
あなたの会社がデータを生み出しているなら、それがどんなデータであっても、対価を払うAI開発企業はほぼ確実に存在します。 掲載用の説明文を準備する.
アクティブな買い手
いま、データを
買っているのは誰か。
これらのAI企業は、FileYieldを通じて積極的に学習データを取得しています。各社にはそれぞれ固有のデータニーズ、予算、取引形態があります。買い手をクリックすると、求めているデータを確認できます。
巨額を投じる企業
AIデータの取得は、ビッグテックの財務で最大級の費目のひとつになりました。2023〜2024年に起きたコンテンツライセンス契約の最初の波では、学習用アクセスに対する定額の年間料金が中心でした。2024年後半には利用量に応じた条件が現れはじめ、2026年には実際の成果に連動する変動価格が標準になりつつあります。
OpenAI は最も積極的な買い手です。News Corpとの契約(総額$250M超、年$50M以上の5年契約)により、The Wall Street Journal、Barron's、MarketWatch、New York Post、The Times、The Sunday Times、The Sunをはじめ、数十の媒体へのアクセスを得ました。さらに、Associated Press(1985年まで遡るアーカイブを対象とする2年契約)、Financial Times、Axel Springer、Dotdash Meredith(最低保証$16M)、Le Monde、Prisa Media、HarperCollinsとも契約を結んでいます。
Google は2024年2月、Redditと年$60Mの画期的な契約を結び、Redditのユーザー投稿による膨大な議論コーパスへのリアルタイムアクセスを得ました。さらに2025年1月には、Geminiを強化するリアルタイムの情報フィードについて、Associated Pressと別途契約を結んでいます。2025年のAI設備投資は$85Bにのぼり、Googleは潤沢な資金と、テキスト、画像、動画、コードにわたる幅広いデータニーズを持っています。
台頭する買い手
Meta は2025年にScale AIの株式約49%を取得し、データパイプラインを自ら持つという姿勢を示しました。Scale AIは主要なAI開発企業の大半でデータラベリングとモデル評価を担っており、Metaはいまや最高品質のラベル付きデータセットに優先的にアクセスできます。Metaは特に、Llamaモデルファミリー向けに、多言語の会話データ、ビジュアルコンテンツ、ソーシャルメディア上のやり取りのパターンを強く求めています。
Anthropic は、AIインフラに約$50Bを投じる計画を発表しました。市場で最も品質を重視する買い手であり、特に科学、医療、法務、金融の分野で、よく構造化され倫理的に調達されたデータセットに相当な上乗せを支払う用意があります。Constitutional AIのアプローチを採るため、安全性分類器の学習には、特に多様で高品質なデータを必要としています。
Amazon, Apple, Microsoft、そして増え続ける業界特化型のAIスタートアップも、データに資金を投じています。MicrosoftとInformaの契約には、前払いの「初期データアクセス料」$10Mが含まれていました。Shutterstockは、AI開発者へのデジタル資産のライセンス供与により2023年だけで$104Mの収益を上げたと報告しており、2027年までに$250Mに達すると見込んでいます。
買い手の層は毎月広がっています。かつて5社だったのが今では15社以上になり、2027年には50社以上になるでしょう。早く販売するほど、交渉力は高まります。
Amazon
AmazonのAIはAlexa、AWS Bedrock、Amazon Nova、そして小売のレコメンデーションエンジンにまで及びます。AWSは2025年第4四半期だけで$35.6Bの収益を上げ、Amazonは$200B超をAIインフラに投資しており、専門的な学習データの最大級の買い手の一つとなっています。
Anthropic
安全性と有用性を重視したAIアシスタント「Claude」の開発元です。Anthropicは2026年初頭までに年率換算収益が$14Bに達し、企業価値は$380Bと評価されており、業界で最も積極的なデータの買い手の一つとなっています。
Cohere
企業向けに特化したAI企業で、企業価値は$7Bと評価されており、NLP、検索、RAGシステムを専門としています。Cohereはプライベート環境での導入モデルを採用しているため、収益の85%がオンプレミスAIによるもので、分野特化型のエンタープライズ学習データへの強い需要を生み出しています。
Databricks
DBRXとMosaicMLを手がける、データレイクハウス企業で、企業価値は$134Bです。Databricksは大規模にエンタープライズデータを処理しており、自社でAIモデルを構築すると同時に、他社によるモデル構築も支援しているため、学習データへの需要は両方向から生まれています。
Deepgram
業界最高水準の音声認識(speech-to-text)および音声合成(text-to-speech)APIを提供する、企業向け音声AI企業です。シリーズCで$130Mを調達し、企業価値は$1.3Bと評価されているDeepgramは、これまでに50,000年分以上の音声データを処理し、最速かつ最も高精度な音声AIプラットフォームとして200,000以上の開発者に利用されています。
Google DeepMind
Gemini、AlphaFold、Veoを手がける、Googleの統合AI研究機関です。8,200人以上の研究者を抱え、Googleの大規模なコンピュート基盤を利用できるDeepMindは、世界最大かつ最も資金力のある、専門的な学習データの買い手の一つです。
Hugging Face
100万以上のモデルと25万以上のデータセットをホストする、オープンソースAIのハブです。Hugging Faceは2024年に$130Mの収益を上げており、データの買い手であると同時に、世界最大のAIデータセットマーケットプレイスとして、データの売り手をAIエコシステム全体と結びつけています。
Meta AI
LLaMA、SAM、Emuを手がける、MetaのAI部門です。MetaはオープンソースAIに力を入れていますが、大規模な学習データセットを必要としており、データラベリング基盤を担うScale AIへの$14.3Bの投資を含め、データ取得に数十億ドル規模の資金を投じています。
Microsoft
OpenAIへの$14Bの投資、Office、GitHub、Azureにわたって拡大を続けるCopilotエコシステム、そしてパブリッシャー向けの自社AIコンテンツマーケットプレイスを持つMicrosoftは、エンタープライズAI分野において最大かつ最も戦略的な学習データの買い手の一つです。
Mistral AI
ヨーロッパを代表するAI企業で、企業価値は$14B、累計資金調達額は$3Bです。MistralはGPT-4に匹敵するオープンウェイトモデルを開発しており、世界で競争していくため、多言語かつ分野特化型の学習データを積極的に取得しています。
OpenAI
GPT-4、ChatGPT、DALL-E、Whisper、Soraの開発元です。OpenAIは2025年に$20Bの収益を上げ、企業価値は$850B超と評価されており、あらゆるモダリティにおいて学習データの最大かつ最も積極的な買い手となっています。
Runway
Gen-3およびGen-4を手がける、AI動画生成のリーディングカンパニーで、企業価値は$5.3Bです。RunwayはShutterstock、Lionsgate、AMC Networksとパートナーシップを結んでおり、業界で最も活発な動画学習データの買い手の一つです。
Scale AI
データアノテーションとAI学習データを手がけるリーディングカンパニーで、Metaから$14.3Bの投資を受けた後の企業価値は$29Bです。Scale AIは2024年に$870Mの収益を上げており、生データを購入すると同時に、それを世界トップクラスのAI企業向けの高品質な学習データセットへと加工しています。
Stability AI
最も広く使われているオープンソースの画像生成モデル「Stable Diffusion」の開発元です。新CEOのPrem Akkarajuのもと、Stability AIは3桁の成長率を記録しながら、映画、テレビ、エンタープライズ向け統合へと事業を拡大し、画像の学習データを積極的に取得しています。
xAI
Elon MuskによるAI企業で、Grokを手がけています。$20Bを調達し、企業価値は$230Bと評価されています。xAIとXの統合により、数億人に及ぶX(旧Twitter)ユーザーのリアルタイムデータへのアクセスを得ていますが、OpenAIやGoogleと競うため、外部データの取得にも積極的に取り組んでいます。
売り手の動向
すでに
対価を得ている企業。
これらの企業は、データライセンスが机上の空論ではなく、現実の収益であることを証明しています。交渉し、契約に署名し、対価を受け取りました。何を売り、何を得たのかを紹介します。
$203M+
ライセンス契約の合計、契約期間2〜3年
買い手: Google ($60M/yr), OpenAI ($70M/yr), others
データ: ユーザーが投稿したフォーラムの議論
News Corp
$250M+
OpenAIとの5年契約
買い手: OpenAI
データ: ニュース記事 — WSJ、NY Post、The Times、The Sun
Shutterstock
$104M
2023年のAIライセンス収益。2027年までに$250Mの見込み
買い手: OpenAI, Meta, Amazon, Google, Apple
データ: ストック写真、イラスト、ベクター素材、動画クリップ
Associated Press
Undisclosed
OpenAIと2年契約、Googleとは別途契約
買い手: OpenAI, Google
データ: 1985年まで遡るニュースアーカイブ
Axel Springer
$5-60M/yr
複数年のライセンス契約
買い手: OpenAI
データ: 欧州のニュース — Bild、Politico、Business Insider
Stack Overflow
Undisclosed
2024年5月に締結
買い手: OpenAI
データ: 開発者のQ&Aディスカッション、コードサンプル
Financial Times
Undisclosed
複数年のライセンス契約
買い手: OpenAI
データ: 経済報道のアーカイブ
Dotdash Meredith
$16M+
OpenAIからの最低保証額
買い手: OpenAI
データ: ライフスタイルコンテンツ — People、Allrecipes、Investopedia
Informa
$10M+
前払いの初期データアクセス料$10M
買い手: Microsoft
データ: B2Bインテリジェンス、学術出版
傾向は明らか
AI企業にデータをライセンス供与した主要なコンテンツプラットフォームは、いずれもそれを大きな収益源にしています。Redditはユーザーの議論を$203M以上の契約に変えました。Shutterstockはストック画像を年間$104MのAI関連収益に変えました。News Corpは報道アーカイブを$250M規模の契約に変えました。
これらは一回限りの取引ではありません。更新条項、段階的な増額条項、利用量に応じた上振れを組み込んだ、複数年のライセンス契約です。先に動いた企業ほど良い条件を得ました。Redditが強い立場で交渉できたのは、自社のデータに単体で価値があることにいち早く気づいたプラットフォームのひとつだったからです。
Redditである必要はありません
報じられた各契約の出典を確認し、内容、範囲、商業的な背景を把握してください。
FileYieldは、掲載の説明文、買い手のリクエスト、商談をひとつにまとめます。掲載を準備し、購入を検討する買い手とライセンスの詳細を直接話し合いましょう。
データを知る
役立つ
データセットの条件。
データの網羅範囲、品質、権利、許諾される用途を説明して、買い手が評価できるようにしましょう。価格は、データセットそのものと、交渉するライセンスの内容で決まります。
会話データ
チャットログ、サポートの記録、フォーラムのスレッドは、範囲も品質もさまざまです。ライセンスについて話し合う前に、許諾、機密保持の措置、想定される用途を明確にしてください。
画像データ
画像の権利、被写体の許諾、解像度、網羅範囲、アノテーションの品質を確認してください。ラベルがあるからといって、価格の上乗せや法的な適合性が裏付けられるわけではありません。
音声データ
同意、話者、言語、録音条件、アノテーションの有無を記録してください。個人的または機密性のある音声には、適切な保護措置が必要です。
動画データ
来歴、許諾、収録時間、網羅範囲、アノテーションを記録してください。想定される用途と必要な準備は、買い手と確認します。
コード・技術データ
リポジトリには、コミット履歴、コードレビューのスレッド、ドキュメント、テストが含まれる場合があります。権利、機密性、品質、買い手の想定用途は確認が必要です。これらの特徴だけから価格の上乗せを推測することはできません。
医療・ヘルスケアデータ
匿名化された患者記録、診療記録、放射線レポート、検査結果。HIPAAへの準拠が必須です。2025年上半期、ヘルスケアAIはデジタルヘルス分野のVC投資の62%を獲得しました。需要は非常に大きいです。
金融データ
取引ログ、市場データ、信用スコアリングの特徴量、不正のパターン。時系列の文脈を持つ高度に構造化されたデータには、高値がつきます。BFSIはAI学習データ市場の7.6%のシェアを占めています。
テキスト・文書データ
テキストの出典、網羅範囲、許諾、構造を記録してください。分類は評価の助けになりますが、価格の上乗せや性能面の成果を裏付けるものではありません。
コールセンターデータ
解決結果、感情ラベル、オペレーター/顧客の役割が付いた通話の文字起こし。多言語の通話データは、会話AIの学習にとって非常に価値があります。
価格を上げる要因
独占性。 ライセンスがどの用途と買い手を、どの期間、どの市場で除外するのかを定めてください。価格を交渉する前に、それらの制約を評価しましょう。特定の上乗せ額を前提にすることはできません。
分野の専門性。 一般的なWebテキストは、もはやありふれたものです。医療記録、訴訟書類、金融取引、産業用センサーのデータは違います。データの専門性が高いほど代替は少なくなり、買い手が支払う額は大きくなります。
品質と準備。 既知の制約と、実施済みのラベリングやクレンジングを記録してください。受け入れ基準は買い手と合意します。FileYieldは元データの検査、準備、認証を行いません。
量と鮮度。 網羅範囲、更新頻度、データフィードを維持するコストを記録してください。継続的なアクセスと支払いには別途の契約が必要です。レコード数が多ければ自動的に収益が増えるわけではありません。
価格を下げる要因
入手しやすさ。 代替となる入手先と、それに付随する権利や制約を考慮してください。公開されているというだけで、適法な利用や価格が決まるわけではありません。
品質の問題。 欠損、不整合、形式の不備があるレコードは、修正が必要になる場合があります。取りかかる前に、責任分担、費用、受け入れ基準について合意してください。
権利とプライバシー。 来歴、許諾、適切な保護措置を整えてください。適用される要件は、法域や想定される用途によって異なります。機微な情報を共有する前に、専門家の助言を受けてください。
ライセンスの制限。 非独占ライセンスと期間限定ライセンスでは、商業的な意味合いが異なります。提案された契約は、それぞれの条件に即して検討してください。範囲と価格の間に、保証された関係はありません。
15
追跡中の買い手プロフィール
69+
収録した公開取引
$154.2B+
報じられた取引総額
取引の設計
データ取引は
実際にどう動くのか。
受け取る対価を最大化するには、取引形態の理解が欠かせません。AIデータのライセンス契約にはいくつかの形があり、それぞれに固有の利点とトレードオフがあります。
永続ライセンス
永続ライセンスでは、交渉で決めた対価と引き換えに、合意した範囲内での継続的な利用を認めることができます。許諾する用途、制限、納品、継続的な義務を定めてください。年間ライセンス価格との決まった関係を前提にすることはできません。
期間限定ライセンス
更新オプション付きの1年または複数年の契約期間。2026年に最も一般的な形態です。継続的な収益と再交渉の機会が得られます。RedditとGoogleの契約は、年$60Mの期間限定の年間ライセンスです。
利用量連動型の価格設定
クエリ、トークン、推論ごとに支払いが発生します。買い手が実際にどれだけデータを使うかに連動する、新しいモデルです。2024年後半には、主要な取引で利用量連動型の条件が登場しました。インセンティブが一致し、モデルが成功するほど収益が増えます。
独占プレミアム
独占契約は将来のライセンス供与を制限します。範囲と期間を定め、機会費用を評価したうえで、条件を交渉してください。一定の上乗せやより良い結果を前提にすることはできません。
レベニューシェア
あなたのデータで学習したAI製品が生む収益の一定割合を受け取ります。2026年に広がりつつある最新のモデルです。Redditの最近の交渉は、成果に連動する変動価格へと向かっています。AI製品が成功すれば、最も大きな上振れが見込めます。
ハイブリッド / 段階型
交渉で決めた前払い金に、利用量に応じた支払いやレベニューシェアを組み合わせることができます。計測方法、報告、監査権、支払条件を定めてください。適否や見返りは契約内容によって異なります。
NDAとコンプライアンス要件
機微な話し合いでは、サンプルや非公開の詳細を共有する前に、秘密保持契約(NDA)が必要になる場合があります。FileYieldは、リサーチディレクトリに掲載された企業と継続的な契約を結んでいると主張するものではありません。各売り手と買い手は、それぞれの取引に適した書類を締結する必要があります。
コンプライアンス文書は、いまや最低限の前提条件です。2025年8月にEU AI法の適用が始まって以来、汎用AI(GPAI)モデルの提供者はすべて、学習に使用したデータセットの概要を公開しなければなりません。つまり買い手は、ライセンスするすべてのデータセットについて、確かな来歴の文書を必要とします。データの出所、同意の取得方法、個人情報(PII)が削除されているか、著作権のオプトアウトがどう尊重されているかを把握する必要があるのです。
FileYieldは、こうした準備に関する論点を洗い出し、文書の整理を支援します。現時点では、個人情報(PII)の削除や法的な認証は行っていません。プライバシー、セキュリティ、法務について専門家によるレビューを受ける責任は、引き続き売り手と買い手にあります。
交渉力
売り手が犯しがちな最大の失敗は、1社の買い手とだけ交渉することです。競争がなければ、価格は買い手が決めます。複数のAI開発企業が同じデータセットに入札すれば、価格は急速に上がります。
FileYieldは承認済みの掲載を公開し、関連する買い手層にターゲットを絞ったアウトリーチを行えます。関心を持つ相手が複数いれば交渉力が高まる可能性はありますが、FileYieldが競合する入札、価格の上昇、成約までの期間を保証することはありません。
長期的にあなたを守る取引形態も交渉します。スクレイピング防止条項(買い手はあなたのデータを使って代替となる合成データを生成できない)、監査権(データがどう使われているかを確認できる)、返還条項(買い手が支払いを怠ったり条件に違反したりした場合、データが返還される)などです。
業界インテリジェンス
活用例を探る、
業界を越えて。
医療・ライフサイエンス
匿名化された診療記録、放射線画像、ゲノムデータ、薬物相互作用のデータベース。2025年上半期、ヘルスケアAIのスタートアップはデジタルヘルス分野のVC投資全体の62%を獲得し、1ラウンドあたりの平均は$34.4Mでした(Rock Health)。ヘルスケアAIは、最も急成長しているAI分野のひとつです。医療モデルを開発するAI開発企業はどこも、合成による近似ではなく、実際の臨床データを必要としています。
金融サービス
取引パターン、不正のシグネチャ、信用スコアリングの特徴量、アルゴリズム取引のデータ、KYC/AMLのパターン。BFSIは2025年にAI学習データ市場の7.6%のシェアを占め、成長が加速しています。高頻度取引の企業は、マイクロ秒単位の市場データに割高な料金を支払っています。
法務・コンプライアンス
裁判所への提出書類、契約書、規制当局への提出資料、コンプライアンス監査、法律意見書。AIを活用したリーガルリサーチは$1.5B以上の市場です。法律事務所やリーガルテック企業は、法域ごとに異なる言葉のニュアンスをとらえた、分野特化の学習データを必要としています。
カスタマーサービス・コールセンター
会話記録は、特定の研究や製品の用途に役立つ場合があります。録音の許諾、プライバシー、言語、網羅範囲、アノテーションを確認してください。これらの特徴があるからといって、買い手の関心や一定の価格上乗せが裏付けられるわけではありません。
EC・小売
詳しい説明付きの商品カタログ、顧客レビューのデータセット、購買行動のパターン、画像検索の学習データ、サプライチェーンと物流のテレメトリ。レコメンドエンジンの学習には、膨大な量の実取引データが必要です。
製造・IoT
センサーのテレメトリ、予知保全のログ、品質管理の画像、ロボットの工程データ。産業向けAIは急成長しており、異常検知や予測モデルには、合成では作れない実際の稼働データが必要です。
メディア・出版
最も目立つ取引カテゴリです。News Corp($250M)、Reddit($203M+)、Shutterstock($104M)、AP、FT、Axel Springerが、いずれも大型のライセンス契約を結んでいます。オリジナルコンテンツを大規模に生み出しているなら、AI開発企業はそれを求めています。
教育・研究
学術論文、カリキュラムデータ、学習成果のデータセット、教育評価データ、個別指導の記録。EdTechのAIが効果的なアダプティブラーニングを実現するには、多様な教育コンテンツとやり取りのパターンが必要です。
プロセス
データライセンスの
プロセスを、ステップごとに。
最初の接触から契約締結、支払いまで。データを販売するときに実際に何が起きるのかを、順を追って説明します。販売の窓口は FileYield.
機密を守ったヒアリング
出発点データセットを普段の言葉で説明し、どこまで開示するかを選びます。必要な場合は、機微な詳細やサンプルを共有する前にNDAを結んでください。
準備状況の評価
売り手主導量、品質、独自性、来歴、個人情報(PII)の有無、許諾される用途を記録します。公開されている類似事例は参考になりますが、評価額を保証するものではありません。
データ準備計画
必要に応じてクレンジング、フォーマット調整、匿名化、同意の証跡、法務レビューのうち、何が必要かを判断します。FileYieldはワークフローを整理できますが、現時点ではこれらの作業の実施や認証は行っていません。
買い手とのマッチングと紹介
時期はさまざま承認された説明文は、マーケットプレイスに掲載されたり、ターゲットを絞ったアウトリーチに使われたりすることがあります。関心を持った買い手から質問や追加のメタデータの依頼が来ることもありますが、反応やタイミングは保証されません。
交渉とタームシート
直接交渉売り手と買い手が、価格、許諾する用途、独占性、納品、監査権、救済措置について話し合います。署名の前に、各当事者は資格のある弁護士に相談すべきです。
契約と支払い
条件が合意に至れば法務、プライバシー、セキュリティのレビューを経て、当事者が契約と支払条件を締結します。形態と時期は取引によって異なります。
継続的な義務
継続中期間限定型や利用量連動型のライセンスでは、報告、監査、削除、更新、執行について契約で定めておくべきです。FileYieldは現時点では、取引後のモデルでの利用状況を検証していません。
市場トレンド
市場はどこへ向かうのか
展望 2026.
合成データと実データ
「合成データが実データに取って代わる」という見方は、すでに完全に否定されています。合成データにはデータ拡張やプライバシー保護といった用途があるものの、主要なAI開発企業はいずれも、合成データだけで学習したモデルが「モデル崩壊」に陥ることを確認しています。世代ごとに前の世代の出力で学習することで、品質が徐々に劣化していく現象です。
AIモデルを本番環境で役立つものにする複雑さ、ノイズ、エッジケースをとらえるうえで、実データに代わるものはありません。合成データへの過熱した期待は、むしろ高品質な実データの価値を押し上げました。実データこそがデモと製品を分ける根本的な違いだと理解したAI開発企業は、いまより高い対価を払っています。
EU AI法の学習データ開示要件(2025年8月から適用)では、提供者は合成データを使用した場合にそれを明示し、生成元のモデルと出所を説明しなければなりません。こうした規制上の透明性が、来歴の明確な、検証可能な実データのデータセットへと買い手を向かわせています。
データの来歴と信頼
「まずスクレイピングし、許しは後で請う」時代は終わりました。複数の訴訟(New York Times v. OpenAI、Getty Images v. Stability AI、Authors Guild v. OpenAI)によって、AI企業には学習データへの正当なアクセスが必要であることが明確になっています。
これはデータの売り手にとって大きな追い風です。AI開発企業は正当な経路でデータのライセンスを受けなければならず、法的リスクを避けるためなら市場価格を支払う用意があります。検証可能な来歴の文書を提供できるFileYieldのような企業こそ、買い手が必要としている存在です。
マルチモーダル需要が急増
GPT-4VやGeminiなどの大規模マルチモーダルモデル(LMM)の台頭により、テキスト、画像、音声、動画を組み合わせたデータセットへの需要が爆発的に高まっています。画像・動画データの分野は、すでにAI学習用データセット市場の41.9%を占めています。音声データは最も急成長しているAI学習分野のひとつで、MarketsandMarketsは、音声認識市場全体について2030年まで約19%のCAGRを予測しています。
AIコンピュートの平均コストは2023年から2025年にかけて89%上昇し、経営幹部はその主な要因として学習データを挙げています。それでも、74%の組織が、マルチモーダルAIはROIの期待を満たす、または上回ると回答しています。需要はとどまるところを知りません。
音声、動画、画像、テキストを組み合わせることで、特定の用途に役立つ場合があります。一方で、準備や権利に関する課題も生じます。複数のモダリティを持つことだけで、買い手の需要や価格の上乗せが裏付けられるわけではありません。
規制の動向
EU AI法は2026年8月に全面適用となり、汎用AI(GPAI)に関する義務は2025年8月から発効しています。汎用AIモデルの提供者はすべて、学習データセットの概要を公開し、著作権法の遵守を示さなければなりません。欧州委員会は、公開データセット、非公開データセット、スクレイピングしたWebコンテンツ、ユーザーデータ、合成データを対象とする、公開開示のための必須テンプレートを公表しました。
米国でも、AIの安全性と透明性に関する大統領令が、(具体的な規定はEUほど細かくないものの)同様の圧力を生んでいます。カリフォルニア州、コロラド州、イリノイ州は、AIに特化したデータ関連法を可決済み、または検討中です。
結論として、規制はデータの売り手にとって追い風です。規制によってAI企業は、正当で記録の残る経路を通じてデータを取得せざるを得なくなります。つまり、コンプライアンスに準拠し監査可能なデータセットを提供できる仲介業者やデータ保有者に、市場価格を支払うということです。
データセットの規模
どんな規模の
データでも。
小規模なコレクションから企業のアーカイブまで、データセットの規模を明確にしましょう。以下の例は、掲載内容を組み立てる参考になります。
小規模企業
1万〜10万件のレコード、ニッチな分野のデータ、または単一モダリティのデータセットを保有する企業。典型的な売り手:専門クリニック、地域のコールセンター、ニッチな出版社、小規模なECプラットフォーム。業務データに少しでも価値があると知って驚く企業も少なくありません。
2年分の通話文字起こしを持つ50席のコールセンター。匿名化済みの記録を25,000件持つ専門クリニック。10年分の業界特化コンテンツを持つニッチなB2B出版社。
中堅企業
10万〜1,000万件のレコード、マルチモーダルデータ、または専門性の高いデータを保有する企業。典型的な売り手:地域の病院グループ、金融アドバイザリー会社、中堅出版社、物流会社、豊富なユーザー行動データを持つSaaSプラットフォーム。
匿名化済みの患者記録を50万件持つ地域の病院グループ。10年分の顧客対応データを持つ金融アドバイザリー会社。500万件のユーザー会話を持つSaaSプラットフォーム。
エンタープライズ
1,000万件以上のレコード、マルチモーダルなデータセット、または世界的に見ても独自性の高いデータ資産を保有する企業。典型的な売り手:全国規模のメディア企業、大規模な医療機関グループ、多国籍金融機関、大手ECプラットフォーム、通信事業者。
Reddit:契約総額$203M以上。Shutterstock:2023年だけで$104M。News Corp:5年間で$250M以上。Dotdash Meredith:1社の買い手からの最低保証額$16M。
継続収益と一回限りの収益
一回限りのライセンスと継続的なアクセス契約では、義務が異なります。継続型の条件では、継続的な納品、サポート、許諾、品質の確約が求められる場合があります。支払いと更新は、交渉した契約内容によって決まります。
継続的に生成されるデータは、双方が合意すれば、継続的なアクセス契約の対象になり得ます。掲載したことをもって、安定した収入、契約の更新、企業価値の評価倍率を前提にしないでください。
複数の取引を重ねる
非独占ライセンスなら、複数の買い手と取引する余地を残せます。自社の権利と既存の契約を確認したうえで、ライセンスごとに許諾する用途を定めてください。
各提案は、価格とあわせて範囲、コスト、義務も比較してください。独占契約を結ぶと、将来得られる機会が変わる可能性があります。
掲載用の説明文を準備する ことで、購入を検討する買い手が評価に必要とする情報を整理できます。
よくある質問
よくある
質問。
AI企業にはどんなデータを販売できますか?
必要とするデータは買い手によって異なります。適合するかどうかは、適法な権利、許諾、品質、網羅範囲、想定される用途によって決まります。FileYieldは説明文の準備を支援できますが、正確な価値を決めたり、買い手を保証したりはしません。
自社のデータには、どのくらいの価値がありますか?
信頼できる見積もりには、出典、日付、通貨、単位、ライセンス範囲をたどれる、関連性のある類似取引が必要です。お持ちのデータセットについて、私たちはそうした根拠を持っていません。希望価格や予算はユーザーが提示したものであり、品質、網羅範囲、権利、許諾される用途は別途評価する必要があります。
自社のデータを販売することは合法ですか?
所有権、契約、同意、プライバシー法、業界ごとの規制、想定される用途によって異なります。FileYieldは、法的助言、個人情報(PII)の削除、コンプライアンスの認証を行いません。規制対象のデータや個人データを掲載・移転する前に、資格のある弁護士やプライバシー/セキュリティの専門家に相談してください。
データを販売すると、顧客情報や競争上の情報が漏れることはありますか?
掲載を公開にするか非公開にするか、サンプルや元データをいつ共有するかは、あなたが管理します。機微な情報は、必要に応じて匿名化し、適切な契約とアクセス制御で保護すべきです。技術的・契約上のどんな保護措置でも、漏えいリスクがゼロであることは保証できません。
プロセスにはどのくらいの期間がかかりますか?
FileYieldとしての平均期間は、まだ確立されていません。期間は、買い手の関心、データの準備状況、デューデリジェンス、セキュリティレビュー、調達手続き、契約の複雑さによって変わります。取引には数週間から数か月かかることもあれば、成立しないこともあります。
FileYieldの手数料はいくらですか?
現在の契約手数料率は、売り手が8%、買い手が6%です。取引を受け入れる前に、適用される手数料、計算の基準、支払いスケジュール、データセット本体の価格を確認してください。本アプリは、データの準備、データセット代金の決済処理、手数料の自動控除を行いません。将来の有料サービスについては、別途条件の確認が必要です。
複数のAI企業に同時に販売できますか?
可能な場合があります。非独占ライセンスなら複数の買い手に許諾できますが、独占契約は将来のライセンス供与を制限するため、慎重に価格を設定すべきです。認められる取引形態は、データに対するあなたの権利と、交渉する契約によって決まります。
EU AI法やデータ規制への対応はどうなりますか?
AI開発者には、来歴、権利、透明性に関するより確かな記録がますます求められています。具体的な義務は、法域、モデル、役割、施行日によって異なります。FileYieldは掲載のメタデータを整理できますが、各当事者は最新の法的助言を受け、必要な表明書、開示資料、ライセンス文書を自ら用意しなければなりません。
データの販売とデータアクセスの販売は、何が違いますか?
データの販売とは、データセットのコピーを買い手に引き渡すことです。データアクセスの販売とは、買い手がコピーを受け取らずに、API経由でデータを照会・処理できるようにすることです。アクセス型のモデルは管理がしやすく、利用量連動型の価格設定にも対応できますが、学習目的では完全なコピーを望む買い手もいます。FileYieldは、あなたにとって価値と管理性が最大になる方を選び、どちらのモデルでも取引を組み立てます。
AI企業は、どうせデータをスクレイピングするのでは?
法的な状況は劇的に変化しました。New York Times、Getty Images、Authors Guildによる訴訟で、無断のスクレイピングには深刻な法的リスクがあることが明確になりました。EU AI法はコンプライアンス文書を求めています。現在、ほとんどのAI開発企業にはデータライセンス専門のチームがあり、法的・品質面の理由から、スクレイピングしたデータよりもライセンスされたデータを積極的に選んでいます。スクレイピングを行う企業は、訴訟、規制当局の罰金、そしてモデルの再学習を強いられるリスクを負い、再学習には数億ドル規模のコストがかかります。
データを販売するのに、データサイエンスのチームは必要ですか?
掲載を作成するだけなら不要です。ただし取引を完了させるには、クレンジング、フォーマット調整、安全な納品、匿名化、アクセス制御といった技術的な作業が必要になる場合があります。FileYieldは現在、要件の整理を支援していますが、データエンジニアリングやコンプライアンス認証を担う専任チームは提供していません。
取引成立後はどうなりますか?
契約では、支払い、許諾する用途、報告、監査、削除、更新、救済措置を定めておくべきです。FileYieldはマーケットプレイス上の記録とメッセージを保管しますが、現時点では、買い手が自社のシステムやモデル内でデータをどう使っているかは監視していません。
合意する前に、データの買い手が誰なのかを確認できますか?
はい。あなたが買い手と取引条件を明示的に承認するまで、データが相手に渡ることはありません。マッチングの段階でFileYieldが買い手に共有するのはデータの説明であり、データそのものではありません。買い手が関心を示した場合は、その身元をあなたに共有するので、進めるかどうかを十分な情報に基づいて判断できます。あらゆる段階で、あなたには拒否権があります。
はじめる
データを説明し、
商談をはじめる。
お持ちのデータ、その使い道、役立つ理由を説明してください。掲載を作成して、買い手の要件を探りはじめましょう。
本ガイドでは、69+ 件の公表済み取引 総額 $154.2B+ を、 15 件の買い手プロフィールとあわせて整理しています。各契約の背景は、出典付きのリサーチでご確認ください。
69+
収録した取引
15
買い手プロフィール
$0
初期費用
機密厳守 · 義務なし · 48時間で回答
一日待つごとに、
AI企業は
別の選択肢を見つけていく。
タイミングだけで、より良い価格が得られるわけではありません。提案されたライセンスは、自社の権利、義務、コスト、ほかの活用方法と照らし合わせて評価してください。市場の論評を理由に、開示や取引を急がないでください。
研究も技術も、時とともに変わります。一般的な市場の論評は、あなたのデータセットに特定の価値があることや、機会が失われることの根拠にはなりません。
掲載を準備する