技术报告 · 2026

让数据自我构建和改进

DataEvolver 是一个自动化数据集构建框架,其中 目标驱动的 loop agents 会选择并组合 text-to-image、image editing、text-to-video 与 image-to-3D 接口,再利用 VLM 反馈和 WebSearch 研究先验,将用户需求或论文转化为可复现的数据 pipeline。

Qisong Zhang, Wenzhuo Wu, Zhuangzhuang Jia, Yunhao Yang, Shuo Zhang 北京邮电大学人工智能学院
📄 arXiv 2605.01789 🏆 KDD Workshop Oral 🎖️ BAAI Poster
DataEvolver 自主合成数据构建管线海报
自主合成数据构建管线 文本扩展 → 文生图 → 分割 → 3D 重建 → 场景渲染 → VLM 评审循环 → 训练就绪数据
Agent 引导
4
生成接口
2
构建路线
24
修复动作
Web
Research Prior

为什么数据集构建需要 Agent 策略

数据集构建已经不再是一条固定路径。有些任务需要图像生成,有些需要图像编辑或视频合成,有些需要 3D 重建和 Blender 插入;论文复现则需要有来源支撑的方法,而不是临时 prompt。

单一路径 pipeline 过于僵硬

一个用户需求可能需要并行的 T2I 候选、一个 image-edit 分支、一个 text-to-video 分支,或一条串行 image-to-3D route。Agent 需要选择合适的组合方式。

合成结果需要语义级修复

僵硬的数值阈值无法诊断“物体漂浮”或“光照不一致”。目标驱动的 agent 会使用 VLM 反馈来决定有针对性的修复。

论文复现需要来源依据

一篇论文或一个 topic 应该产出可追溯的数据集构建交付:引用来源、官方 artifacts、评价参考和可复用需求。

两条相互连接的数据集构建路线

DataEvolver 将 agent 编排的多模态生成路线与 WebSearch 引导的研究先验路线结合起来。Agent 可以并行、串行,或采用混合策略运行不同接口,以更快构建更高质量的数据集。

Text-to-Image

从 prompt 生成源物体、场景参考或候选视觉概念。

Image Edit

基于已接受的 source 生成受控变体、目标图像和编辑样本对。

Text-to-Video

当需要序列数据时,将静态生成扩展到时序物体或场景工作流。

Image-to-3D

重建带纹理的物体,用于 Blender 插入、场景渲染和 VLM 修复。

DataEvolver six-stage synthetic data generation pipeline
代表性的串行 3D route image-to-3D 路径是一条具体的串行策略:prompt / 图像生成、分割、3D 重建、Blender 渲染和 VLM review。
1
需求策略
Agent 将用户目标映射到接口选择
2
可组合接口
T2I、image edit、T2V 和 image-to-3D
3
分支编排
并行、串行或混合执行
4
3D Route
物体图像到纹理 mesh,再进入 Blender
5
场景上下文
可选 HYWorld / WorldMirror 支持
6
Review 与导出
VLM 修复 loop、metadata 与数据集交付

WebSearch 引导的可复现研究 pipeline

研究先验工作流会将论文、topic 或生成需求转化为可复现的数据集构建交付。当前 agent 执行 WebSearch 和论文阅读,并动态组合串行与并行的 t2i、edit、i2v 和 3D routes;DataEvolver 则保留来源笔记、trace 事件、gallery sheets 和 research_prior.json 以便 replay。

研究引导的 Pipeline

single-paper 与 universal 两种模式合并为一个有来源支撑的工作流,用于可复现的数据集构建和可评价的交付。

WebSearch-guided reproducible research pipeline from paper or topic input to evidence handoff
WebSearch 引导的可复现研究 pipelines Agent 检索论文、官方 artifacts、代码和数据集,然后记录 evidence、GT references、manifests、lineage 和 research_prior.json。
单图 Route 案例

Robot Safety Signal: T2I → Edit → I2V

这是从一张已接受图像出发的三阶段示例。route 先生成 text-to-image 基础图,再通过定向 image editing 推进选中帧,最后以编辑结果作为短运动合成的 anchor。

1基础图像
1Edit Pass
1I2V Clip
混合策略
Robot base image generated by text-to-image
T2I Base
初始机器人渲染

干净的实验室机器人场景,中央握持一个蓝色透明立方体。

Robot edited image with safety signal and green status lights
Edit Pass
加入安全信号

定向 edit 在保留姿态和场景布局的同时,加入绿色状态灯和前部安全标记。

I2V Output
可用于运动生成的结果

编辑后的图像成为短 image-to-video 生成 pass 的视觉 anchor。

串行 / 并行策略编排

当替代方案成本较低时使用并行搜索;一旦选中稳定图像 anchor,再切换到串行推进。

并行 探索基础候选

展开 prompts、seeds 或风格变体,快速比较可能的机器人场景。

选择 推进一个 anchor

选择姿态、物体位置和场景一致性最清晰的一帧。

串行 应用定向 edit

先锁定几何和相机,再加入安全指示和状态灯。

串行 生成运动

将编辑后的图像作为 I2V 输入 anchor,使 identity 和视觉编辑延续下去。

并行 T2I 搜索 Anchor 选择 串行 edit 串行 I2V 可 replay 的交付

串行 / 并行 Route Planner

Agent 将 research prior 转化为 route 决策:将低成本分支一起运行,仅在必要时级联依赖步骤,并通过 manifests 和 gallery records 保持选定方案可 replay。

并行
展开候选

当任务需要多样性、快速比较或多个视觉假设时,并排运行 t2i、edit 或 i2v 候选。

串行
级联依赖

当后续阶段需要已验证的上游 artifacts 时,串联 image -> edit -> i2v 或 image -> 3D -> Blender。

方案选择
评估 route utility

从成本、来源覆盖、reference 可用性、预期质量和 replay 要求中选择风险最低的方案。

WebSearch prior-> 来源方案-> Route 评分-> 串行 / 并行执行-> Gallery 交付
论文
Single-Paper Mode

通过区分官方 artifacts 和生成代理来复现目标论文,并记录数据集方法、metrics、GT references 以及缺失资产决策。

Topic
Universal Mode

搜索 3-5 篇相关论文,提取共享数据集需求,并综合出可用于生成、评价和可追溯输出的复用方案。

Research Handoff

  • 由 agent 执行 WebSearch 和论文阅读,DataEvolver 保留来源笔记和 trace events。
  • 动态 route planning 决定何时串行或并行运行 t2i、edit、i2v 与 3D。
  • 官方开放数据集和评价标准会作为 GT references,而不是被 VLM-only acceptance 取代。
  • 每条被接受的 route 都会导出 prompts、manifests、review sheets 和可 replay 的交付记录。
WebSearch-guided single-paper universal 动态方案 research_prior.json

作为 3D Route 增强项的 HYWorld / WorldMirror

HYWorld / WorldMirror 是一个可选的 world_model route,用于增强 3D reconstruction 路线。它会在物体插入前构建场景上下文,并要求 contract-backed geometry、pure-scene multi-view renders、manifests 和 lineage records。

HYWorld automated 3D scene reconstruction pipeline
可选场景上下文 route Prompt or image → HY-Pano → HYWorld / WorldMirror geometry → Blender scene contract → pure-scene validation → object insertion.

Contract-Backed Geometry

HY-Pano 生成 360° context;HYWorld 和 WorldMirror 重建 depth、camera priors、support surfaces 与 scene geometry,而不是接受固定的 panorama shell。

可追溯 Review

在任何 object-scene render 被推进前,该 route 会保留 pure-scene renders、placement contracts、support checks 和 lineage hashes。

Route Records

  • 保留 HY-Pano 与完整 worldgen 的运行 artifacts 和 SHA-256 manifests。
  • 物体插入前的 pure-scene multi-view renders。
  • 带 scene-camera matching 的 mesh-raycast support placement。
  • 最终 object-scene reports 包含 RGB、masks、depth、normals、metadata gates 和 lineage,而不是 VLM-only acceptance。
world_model profile HYWorld WorldMirror Blender contract
720p 3D Route Case Pack

HYWorld Qwen2.5-12B In-place Object Rotation

这是从压缩报告中抽出的紧凑预览,打包了两个 HYWorld scenes、固定相机 source RGB backgrounds、mesh-zbuffer object placement、每个物体八个 yaw angles,以及用于可 replay 3D 数据集构建的 validation records。

2场景
2物体
8Yaw Views
720p输出
34增强 RGB
通过验证
HYWorld scene 001 object 001 in-place rotation contact sheet
Scene 001 / object 001 原始打包 contact sheet:静态相机、固定世界位置、八个 yaw samples。
HYWorld scene 002 object 009 in-place rotation contact sheet
Scene 002 / object 009 原始打包 contact sheet:第二个场景,同样的原地旋转 review checks。

验证摘要

  • 场景静态、相机静态,并保留 source RGB background。
  • 物体在原地旋转时保持固定世界坐标。
  • 经过 harmonization 和 super-resolution 后,所有 yaw angles 都可见。
  • Manifest、lineage、masks、metadata 与 validation report 随 archive 一起保留。

目标驱动 Loop Agents:感知、诊断、行动、重复

在 3D reconstruction route 中, goal-driven loop agent 通过 VLM review 感知渲染结果,诊断语义问题,从结构化 action space 中选择定向渲染调整,并不断重复直到达到质量目标。

DataEvolver closed-loop scene refinement pipeline
闭环场景优化 渲染、review、行动,并在 quality gate 返回 keep 时停止。
Blender Render
Cycles 512spp,1024×1024
VLM Review
Qwen3.5-35B 自由形式 critique
Agent 决策
读取 review,并从 24 个 actions 中选择
Quality Gate
判定:keep / revise / reject
Loop 持续到 reviewer 给出 keep

抗振荡控制

通过 sign-flip tracking、dead-zone detection 和 step-scale scheduling 防止无限 loop 和参数震荡。

场景感知渲染

物体可插入配置好的 Blender scenes,或带 support-surface checks 的可选 HYWorld / WorldMirror scene context。

24 个 Atomic Actions

覆盖光照、物体 transform、场景环境和材质属性组的结构化 action space。

DataEvolver-Rotate:视角可控的旋转编辑

一个用于 rotation-conditioned image editing 的 benchmark 数据集。每个样本将标准正面图与自然语言指定的目标视角配对。

50
唯一物体
8
每个物体的视角
350
训练样本对
3×A800
基础设施
Python — 加载数据集
import json
from pathlib import Path
from PIL import Image

root = Path("dataset_scene_v7_full50_rotation8_...")
rows = []
with (root / "pairs/train_pairs.jsonl").open("r") as f:
    for line in f:
        rows.append(json.loads(line))

row = rows[0]
source = Image.open(root / row["source_image"]).convert("RGB")
target = Image.open(root / row["target_image"]).convert("RGB")
instruction = row["instruction"]

24 个结构化 Atomic Actions

在 3D reconstruction route 中,agent 从离散、结构化的 action space 中选择动作,处理 VLM 识别出的渲染问题。每个 action 都对应一个有边界的 Blender 参数。

Key Light 强度

×1.2 / ×0.8 乘法调整,边界 [0.5, 2.0]

Key Light 旋转

±15° yaw 步长,边界 [-90°, 90°]

环境光强度

×1.2 / ×0.8 乘法调整,边界 [0.5, 2.0]

环境旋转 (Z)

±30° 步长,边界 [-180°, 180°]

物体高度

±0.02 步长,边界 [-0.1, 0.1]

材质粗糙度

±0.08 步长,边界 [-0.3, 0.6]

+ 另有 18 个 actions — 见 scene_action_space.json

关键差异点

DataEvolver 的差异不在于一次模型调用,而在于 agent 如何选择 routes、保留运行记录、修复失败并导出可复用的数据集构建 traces。

Agent 编排接口

Agent 可以根据数据集目标,并行、串行或以混合策略组合 T2I、image edit、T2V 和 image-to-3D routes。

VLM 作为反馈,而不是分数

自由形式的自然语言反馈能提供数值分数无法表达的语义诊断。reviewer 会指出 为什么 一次渲染失败。

研究支撑的 Pipelines

WebSearch 引导的研究会在下游生成前记录来源笔记、数据集方法、官方 artifacts 和评价 references。

从评价到优化的路径

已接受 traces、失败案例和生成的 evaluation sets 可用于指导后续 LoRA tuning,从而获得更强的重建和编辑模型。

构建技术

支撑 DataEvolver 多模态生成、3D 重建和 research-prior workflows 的模型、框架和可追溯记录。

Python 3.10+ Blender 4.2+ Cycles Path Tracing PyTorch 2.8 Qwen-Image-2512 Image Edit Workflow Text-to-Video Workflow SAM3 Hunyuan3D-2.1 HYWorld / WorldMirror Qwen3.5-35B-A3B Qwen-Image-Edit-2511 DiffSynth-Studio WebSearch Research research_prior.json LoRA (PEFT) 3×A800 80GB

快速开始

从轻量 dry-run 路径开始。它会验证 setup 形态并打印本地计划,不下载模型、不写入 tokens,也不启动 GPU 作业。

Shell — 设置
git clone https://github.com/PRIS-CV/DataEvolver.git
cd DataEvolver

# Safe onboarding dry-run
bash src/dataevolver/cli/bootstrap_dataevolver_default.sh \
  --profile quick \
  --dry-run

# Review the reproducible research handoff format
find outputs -name research_prior.json -print

# Read the public documentation
cat README.md

引用

如果你在研究中使用 DataEvolver 或 DataEvolver-Rotate,请引用我们的工作。

BibTeX
@misc{zhang2026dataevolverletdatabuild,
  title        = {DataEvolver: Let Your Data Build and Improve
                  Itself via Goal-Driven Loop Agents},
  author       = {Qisong Zhang and Wenzhuo Wu and Zhuangzhuang Jia
                  and Yunhao Yang and Huayu Zhang and Xianghao Zang
                  and Zhixiang He and Zhongjiang He and Kongming Liang
                  and Zhanyu Ma},
  year         = {2026},
  eprint       = {2605.01789},
  archivePrefix= {arXiv},
  primaryClass = {cs.AI},
  url          = {https://arxiv.org/abs/2605.01789}
}

Honors & Recognition

DataEvolver 在学术 workshop review 和 agent-for-science competition presentation 中获得的公开认可。

🏆 Oral Presentation

AIDataSci 2026, KDD 2026 Workshop

DataEvolver 被 AIDataSci 2026 workshop 接收为 Oral Presentation。

🎖️ Poster Presentation

2026 BAAI Conference Agent for Science Competition

DataEvolver 获得 Certificate of Poster Presentation,并入选现场 poster presentation。

DataEvolver BAAI Agent for Science poster presentation certificate
BAAI Agent for Science Competition Certificate of Poster Presentation, 2026.

准备构建有研究支撑的数据 pipeline 了吗?

克隆仓库,运行安全 dry-run,然后选择多模态生成 route 或 WebSearch 引导的研究 route。

在 GitHub 上开始