DATA MARKETPLACE · 数据市场

成品数据集,即选即用

三十大类 · 4,000+ SKU 成品数据集目录。具身 Ego 与公开视频数据为主力,辅以本体采集数据——每一份都带完整授权链路、统一 Schema 与免费样例。

30 大类细分 4,000+ SKU
2.3B+视频片段池 · 截至 2026Q1
50,000h+4D / Ego 采集储备
100%授权链路可溯源
EGO·POV
主推EGO · RLDS
真人第一人称家务操作示范,含手部动作语义、任务分解与物体交互标注。受控实拍 + 遥操作双源,知情同意 + 全程脱敏。
1,200h+时长
60+任务族
RLDS格式
KITCHEN·8scenes
主推EGO · LeRobot v3
厨房场景族第一人称操作数据,覆盖备菜 / 烹饪 / 清洁等任务链,动作序列与语言指令精确对齐。
8 类场景族
对齐语言指令
LeRobot格式
NAV·INDOOR
EGO空间理解
第一人称室内移动与导航数据,含空间关系标注、路径语义与障碍交互事件,服务空间理解与导航策略训练。
多户型环境覆盖
空间关系标注
RLDS格式
CINE·2M+ CLIPS
主推视频生成
电影级画质切片,附场景 / 视觉 / 叙事 / 特征 / 情感稠密标注,关键帧检测准确率 >90%*,视频生成基础模型首选语料。
200万+切片
稠密标注
合规三层授权
DOCU·PHYSICS
主推世界模型
纪录片级真实物理影像切片,覆盖自然运动、材质交互与光影变化——世界模型与物理常识学习的高保真语料。
500万+切片
真实物理影像
IP 链可溯源
ACTION·POOL 2.3B+
视频蒸馏VLA
精选自 2.3B+ 片段池的真实人类动作数据,附动作语义与时序标注——视频蒸馏路线的规模化弹药。
2.3B+母池规模
120+任务族
时序动作标注
4D·MULTI-CAM
辅助本体 · 4D
多机位同步 4D 视频,空间对齐误差厘米级*,配套动作语义与空间关系标注——空间理解模型的定制底座。
50,000h+储备
厘米级空间对齐*
DaaS定采模式
TELEOP·TRAJ
辅助遥操作
真机遥操作末端执行器轨迹与动作序列,与视觉帧精确对齐,适配 VLA 后训练与模仿学习。
60+任务族
帧级视觉对齐
RLDS格式
SOCIAL·10 REGIONS
社媒SFT · RAG
覆盖 10 区域主流社媒平台的创作者、帖文与评论数据,含情感标签、ASR 转写与 OCR 字段,PII 全量脱敏。
30+语种
10 区域平台覆盖
100%PII 脱敏
SKU·2.1B+
电商多模态对齐
SKU 级商品图文对齐数据,覆盖主流电商平台,服务多模态检索、商品理解与生成式电商应用。
2.1B+SKU 图
图文对齐对
Parquet格式
XBORDER·30+LANG
跨境电商多语种
商品、评论与搜索语料覆盖主流跨境平台,30+ 语种本地化处理,SFT / RAG 即用。
30+语种
200+国家地区
JSONL格式
TEXT·23B+
文本SFT
精选自 23B+ 文本池的高质量内容评论语料,人机协同清洗,观点与情感标签齐备。
23B+母池规模
情感标签
JSONL格式

没有找到需要的数据集?

三十大类之外,艺恩支持按场景族、任务族与格式定制采集与加工——从需求评审到首批交付,最快 6 周闭环。

咨询定制数据 →

* 标注数字为产品口径 · 内部测评示意值,截至 2026Q1;全部数据集附授权链路文档与免费小规模样例。