
合成テキストのみで学習したモデルは、人が実際に話す言葉から離れていきます。私たちは多言語の会話データを、同意と追跡可能性を確保しながら収集・整備・構造化し、文書化します。
提供内容
本物の人間の会話
テンプレートではない自然な対話。ビジネスや接客の文脈を広くカバーします。
多言語対応
英語・フランス語・スペイン語・ドイツ語・ポルトガル語・オランダ語・中国語・日本語をネイティブが確認。
クレンジングと構造化
重複排除、正規化、タグ付けを行い、JSONLまたはParquetでスキーマ付き納品。
同意と追跡可能性
出所を明記し、個人情報を除去。利用範囲を明確にしたライセンスを付与します。
学習パイプライン向け
各データセットにはデータカード(出所、言語、件数、整備ルール、既知の制限、評価分割)を添付します。
01
仕様策定
言語、領域、形式、件数、品質基準を貴社チームと定義します。
02
収集とクレンジング
同意のもと収集し、個人情報を除去して正規化します。
03
納品と改善
まずサンプルを検証いただき、その後に完全版と文書を納品します。
進め方
よくあるご質問
個人データの扱いは?
納品前に識別情報を削除または仮名化し、すべての出所は同意のもとで記録しています。
納品形式は?
標準はJSONLとParquet、ご要望に応じCSV。スキーマ・件数・制限を記したデータカードを添付します。
専門領域向けの構築は可能ですか?
可能です。多くは個別構築で、言語・領域・件数をご指定のうえ、まずパイロットを実施します。
ご興味がありますか?
モデル用のデータが必要ですか?
言語・領域・件数をお知らせください。サンプルとご提案をお送りします。