DataEvolver 是一个自动化数据集构建框架,其中 目标驱动的 loop agents 会选择并组合 text-to-image、image editing、text-to-video 与 image-to-3D 接口,再利用 VLM 反馈和 WebSearch 研究先验,将用户需求或论文转化为可复现的数据 pipeline。
数据集构建已经不再是一条固定路径。有些任务需要图像生成,有些需要图像编辑或视频合成,有些需要 3D 重建和 Blender 插入;论文复现则需要有来源支撑的方法,而不是临时 prompt。
一个用户需求可能需要并行的 T2I 候选、一个 image-edit 分支、一个 text-to-video 分支,或一条串行 image-to-3D route。Agent 需要选择合适的组合方式。
僵硬的数值阈值无法诊断“物体漂浮”或“光照不一致”。目标驱动的 agent 会使用 VLM 反馈来决定有针对性的修复。
一篇论文或一个 topic 应该产出可追溯的数据集构建交付:引用来源、官方 artifacts、评价参考和可复用需求。
DataEvolver 将 agent 编排的多模态生成路线与 WebSearch 引导的研究先验路线结合起来。Agent 可以并行、串行,或采用混合策略运行不同接口,以更快构建更高质量的数据集。
从 prompt 生成源物体、场景参考或候选视觉概念。
基于已接受的 source 生成受控变体、目标图像和编辑样本对。
当需要序列数据时,将静态生成扩展到时序物体或场景工作流。
重建带纹理的物体,用于 Blender 插入、场景渲染和 VLM 修复。
研究先验工作流会将论文、topic 或生成需求转化为可复现的数据集构建交付。当前 agent 执行 WebSearch 和论文阅读,并动态组合串行与并行的 t2i、edit、i2v 和 3D routes;DataEvolver 则保留来源笔记、trace 事件、gallery sheets 和 research_prior.json 以便 replay。
single-paper 与 universal 两种模式合并为一个有来源支撑的工作流,用于可复现的数据集构建和可评价的交付。
展示 edit route、universal 论文综合、VLM review 和单页交付的可视化检查点。
这是从一张已接受图像出发的三阶段示例。route 先生成 text-to-image 基础图,再通过定向 image editing 推进选中帧,最后以编辑结果作为短运动合成的 anchor。
干净的实验室机器人场景,中央握持一个蓝色透明立方体。
定向 edit 在保留姿态和场景布局的同时,加入绿色状态灯和前部安全标记。
编辑后的图像成为短 image-to-video 生成 pass 的视觉 anchor。
当替代方案成本较低时使用并行搜索;一旦选中稳定图像 anchor,再切换到串行推进。
展开 prompts、seeds 或风格变体,快速比较可能的机器人场景。
选择姿态、物体位置和场景一致性最清晰的一帧。
先锁定几何和相机,再加入安全指示和状态灯。
将编辑后的图像作为 I2V 输入 anchor,使 identity 和视觉编辑延续下去。
Agent 将 research prior 转化为 route 决策:将低成本分支一起运行,仅在必要时级联依赖步骤,并通过 manifests 和 gallery records 保持选定方案可 replay。
当任务需要多样性、快速比较或多个视觉假设时,并排运行 t2i、edit 或 i2v 候选。
当后续阶段需要已验证的上游 artifacts 时,串联 image -> edit -> i2v 或 image -> 3D -> Blender。
从成本、来源覆盖、reference 可用性、预期质量和 replay 要求中选择风险最低的方案。
通过区分官方 artifacts 和生成代理来复现目标论文,并记录数据集方法、metrics、GT references 以及缺失资产决策。
搜索 3-5 篇相关论文,提取共享数据集需求,并综合出可用于生成、评价和可追溯输出的复用方案。
HYWorld / WorldMirror 是一个可选的 world_model route,用于增强 3D reconstruction 路线。它会在物体插入前构建场景上下文,并要求 contract-backed geometry、pure-scene multi-view renders、manifests 和 lineage records。
HY-Pano 生成 360° context;HYWorld 和 WorldMirror 重建 depth、camera priors、support surfaces 与 scene geometry,而不是接受固定的 panorama shell。
在任何 object-scene render 被推进前,该 route 会保留 pure-scene renders、placement contracts、support checks 和 lineage hashes。
这是从压缩报告中抽出的紧凑预览,打包了两个 HYWorld scenes、固定相机 source RGB backgrounds、mesh-zbuffer object placement、每个物体八个 yaw angles,以及用于可 replay 3D 数据集构建的 validation records。
在 3D reconstruction route 中, goal-driven loop agent 通过 VLM review 感知渲染结果,诊断语义问题,从结构化 action space 中选择定向渲染调整,并不断重复直到达到质量目标。
通过 sign-flip tracking、dead-zone detection 和 step-scale scheduling 防止无限 loop 和参数震荡。
物体可插入配置好的 Blender scenes,或带 support-surface checks 的可选 HYWorld / WorldMirror scene context。
覆盖光照、物体 transform、场景环境和材质属性组的结构化 action space。
一个用于 rotation-conditioned image editing 的 benchmark 数据集。每个样本将标准正面图与自然语言指定的目标视角配对。
import json from pathlib import Path from PIL import Image root = Path("dataset_scene_v7_full50_rotation8_...") rows = [] with (root / "pairs/train_pairs.jsonl").open("r") as f: for line in f: rows.append(json.loads(line)) row = rows[0] source = Image.open(root / row["source_image"]).convert("RGB") target = Image.open(root / row["target_image"]).convert("RGB") instruction = row["instruction"]
展示 7 个不同 Blender scenes 中通过 VLM gate 的最佳渲染结果。每个物体都会由目标驱动 loop agents 自动放置、打光并迭代优化。
在 3D reconstruction route 中,agent 从离散、结构化的 action space 中选择动作,处理 VLM 识别出的渲染问题。每个 action 都对应一个有边界的 Blender 参数。
×1.2 / ×0.8 乘法调整,边界 [0.5, 2.0]
±15° yaw 步长,边界 [-90°, 90°]
×1.2 / ×0.8 乘法调整,边界 [0.5, 2.0]
±30° 步长,边界 [-180°, 180°]
±0.02 步长,边界 [-0.1, 0.1]
±0.08 步长,边界 [-0.3, 0.6]
+ 另有 18 个 actions — 见 scene_action_space.json
DataEvolver 的差异不在于一次模型调用,而在于 agent 如何选择 routes、保留运行记录、修复失败并导出可复用的数据集构建 traces。
Agent 可以根据数据集目标,并行、串行或以混合策略组合 T2I、image edit、T2V 和 image-to-3D routes。
自由形式的自然语言反馈能提供数值分数无法表达的语义诊断。reviewer 会指出 为什么 一次渲染失败。
WebSearch 引导的研究会在下游生成前记录来源笔记、数据集方法、官方 artifacts 和评价 references。
已接受 traces、失败案例和生成的 evaluation sets 可用于指导后续 LoRA tuning,从而获得更强的重建和编辑模型。
支撑 DataEvolver 多模态生成、3D 重建和 research-prior workflows 的模型、框架和可追溯记录。
从轻量 dry-run 路径开始。它会验证 setup 形态并打印本地计划,不下载模型、不写入 tokens,也不启动 GPU 作业。
git clone https://github.com/PRIS-CV/DataEvolver.git cd DataEvolver # Safe onboarding dry-run bash src/dataevolver/cli/bootstrap_dataevolver_default.sh \ --profile quick \ --dry-run # Review the reproducible research handoff format find outputs -name research_prior.json -print # Read the public documentation cat README.md
如果你在研究中使用 DataEvolver 或 DataEvolver-Rotate,请引用我们的工作。
@misc{zhang2026dataevolverletdatabuild,
title = {DataEvolver: Let Your Data Build and Improve
Itself via Goal-Driven Loop Agents},
author = {Qisong Zhang and Wenzhuo Wu and Zhuangzhuang Jia
and Yunhao Yang and Huayu Zhang and Xianghao Zang
and Zhixiang He and Zhongjiang He and Kongming Liang
and Zhanyu Ma},
year = {2026},
eprint = {2605.01789},
archivePrefix= {arXiv},
primaryClass = {cs.AI},
url = {https://arxiv.org/abs/2605.01789}
}
DataEvolver 在学术 workshop review 和 agent-for-science competition presentation 中获得的公开认可。
DataEvolver 被 AIDataSci 2026 workshop 接收为 Oral Presentation。
DataEvolver 获得 Certificate of Poster Presentation,并入选现场 poster presentation。