Improvements
AIモデル性能を引き出す高品質データの実証成果。
専門家が設計したデータセットで、ベンチマークスコアを実改善。
専門家が設計したデータセットで、ベンチマークスコアを実改善。

医療データセット
医療ドメインにおけるLLMの回答品質を、実運用の評価基準で改善するためのデータセット
Benchmark | HealthBench1gpt-oss-20b(SFT + DPO)16.1732.172gpt-oss-20b(SFT のみ)15.8631.86
マルチターン安全性データセット
会話が長くなるほど崩れる「マルチターンでの安全性」を強化するためのデータセット
Benchmark | AnswerCarefully / SafeDialBenchAnswerCarefully1Gemma3-27B11.3190.182Qwen3-32B9.5286.01SafeDialBench1Gemma3-27B15.8749.44
指示追従データセット
複数・複雑な指示にも正確に従う能力を強化するためのチューニングデータ
Benchmark | M-IFEval(日本語)1cogito-v1-preview-qwen-32B1.2260.732shisa-v2-qwen2.5-32b1.4458.85
数学推論データセット
LLMの数学推論能力を、“最終答”ではなく“解き方(過程)”から改善するデータセット
Benchmark | AIME 2024/20251AIME 20251043.32AIME 20241036.7
安全性データセット
LLMがより安全な回答を、品質を落とさずに行えるようにするためのデータセット
Benchmark | AnswerCarefully / SORRY-BenchAnswerCarefully v2.2 — Acceptable Rate1Qwen3.5-9B-Base13.480.22Qwen3.5-27B5.789.83Qwen3.5-9B (Instruct)3.174.7
データで、
革新のきっかけを。
APTOの高品質AIデータで、あなたのビジネスに新たな可能性を。
まずは資料請求からお気軽にお問い合わせください。