AI学習用データセット

AI・LLM学習のための実際の人間の会話データ

実際の人間のコミュニケーションから作成した、多言語・クレンジング済み・構造化データセット。

多言語の会話データがAI学習用データセットへ構造化される様子のイラスト

合成テキストのみで学習したモデルは、人が実際に話す言葉から離れていきます。私たちは多言語の会話データを、同意と追跡可能性を確保しながら収集・整備・構造化し、文書化します。

提供内容

本物の人間の会話

テンプレートではない自然な対話。ビジネスや接客の文脈を広くカバーします。

多言語対応

英語・フランス語・スペイン語・ドイツ語・ポルトガル語・オランダ語・中国語・日本語をネイティブが確認。

クレンジングと構造化

重複排除、正規化、タグ付けを行い、JSONLまたはParquetでスキーマ付き納品。

同意と追跡可能性

出所を明記し、個人情報を除去。利用範囲を明確にしたライセンスを付与します。

学習パイプライン向け

各データセットにはデータカード(出所、言語、件数、整備ルール、既知の制限、評価分割)を添付します。

01

仕様策定

言語、領域、形式、件数、品質基準を貴社チームと定義します。

02

収集とクレンジング

同意のもと収集し、個人情報を除去して正規化します。

03

納品と改善

まずサンプルを検証いただき、その後に完全版と文書を納品します。

進め方

よくあるご質問

個人データの扱いは?

納品前に識別情報を削除または仮名化し、すべての出所は同意のもとで記録しています。

納品形式は?

標準はJSONLとParquet、ご要望に応じCSV。スキーマ・件数・制限を記したデータカードを添付します。

専門領域向けの構築は可能ですか?

可能です。多くは個別構築で、言語・領域・件数をご指定のうえ、まずパイロットを実施します。

ご興味がありますか?

モデル用のデータが必要ですか?

言語・領域・件数をお知らせください。サンプルとご提案をお送りします。

サイトがない場合は「なし」とご記入ください。

WebOpen