CASE 01 / PROFESSIONAL EXPERIENCE

字节跳动 · 视频生成 Agent · 5 个月实习

视频生成 Agent,
如何判断它真正可用?

面向豆包端内创作及方舟 API 短剧生成场景,我参与基于 Seedance 模型的视频生成 Agent 建设,负责推进评测体系建设,聚焦质量评估、问题归因与策略优化,支撑能力上线及版本准入。

评测体系建设Agent 问题归因版本评估与准入
01 / 核心问题

为什么视频 Agent 需要体系化评测?

短剧和用户创作任务涉及多镜头、多角色与多阶段生成。单看画面观感,难以判断 Agent 是否完成用户意图,也难以说明问题出在模型、规划还是后续处理。

评测首先要明确测什么,再判断输出是否可用、解释问题为什么发生。Benchmark、MOS 与 Trace 分别承担这三层判断,再通过专项验证支持策略优化与版本判断。

01 / BENCHMARK定义测什么任务场景 · 能力覆盖 · 验收标准
02 / MOS判断好不好视频输出的整体质量与可用性
03 / TRACE解释为什么执行环节 · 问题来源 · 人工归因

策略优化专项验证版本判断

02 / BENCHMARK 构建

测什么,如何确保题目有效覆盖能力?

让每道题,都能测出具体能力。

我参与的 Benchmark 构建以真实用户任务为起点:通过场景分类定义任务覆盖范围,叠加 Agent 能力标签,明确每道题重点考察什么,再结合输入素材、对话链路和验收标准形成可执行的评测 Case。

BENCHMARK STRUCTURE 公开构题方法示意
01 / 场景分类

用户要做什么

通用创作 / 短剧专项

02 / 能力标签

Agent 要具备什么

规划 / 记忆 / 工具编排

03 / 验收标准

什么叫任务成功

最终结果 / 执行链路

形成可执行的 Benchmark Case

输入素材 · 用户对话链路 · 关键考点 · 预期结果 · 失败标准

覆盖矩阵检查 + 版本化维护

按场景与能力检查覆盖,结合迭代评测、发版评测与专项评测维护题目。

CASE EXAMPLE / 脱敏构题示意

短剧空间站位与跨镜头一致性

场景标签
短剧正片 · 现代都市
Agent 能力标签
长程任务规划 · 跨轮记忆 · 参考素材理解 · 资产复用 · 跨阶段一致性

重点验证的能力

检查 Agent 能否理解空间站位参考信息,在多轮任务中继承角色和空间关系,并将约束延续到后续镜头生成。

  1. 理解站位参考
  2. 继承角色与空间关系
  3. 延续至后续镜头
视频结果评测

角色站位与跨镜头连续性

观察最终成片是否满足空间关系与连续性要求。

Agent 任务执行评测

规划、信息引用与素材复用

检查中间规划、参考信息引用及素材复用是否符合任务要求。

依据提供的标签与构题逻辑整理的公开展示示例,不代表原始题目或内部验收细则,也不展示实际测评结果。

03 / MOS 质量标准

什么样的输出才算可用?

此前三分档难以有效拉开视频质量差异,我整合评测标准,形成 MOS 五分档及判定依据,支持多版本评测。评分结合整体观感、需求匹配、核心主体,以及音画和字幕对理解的影响。

DECISION 01 / 为什么采用五分档?评分是整体质量判断,不是错误标签的简单累积。结合问题出现频率、持续时间、影响范围与用户观看体验进行判断,五分档更能体现视频间的差距。
01指令与参考遵循Prompt / 参考图
02角色与空间一致性跨镜头连续性
03动态效果动作与运动表现
04音画同步声音与画面关系
05分镜合理性叙事与镜头衔接
04 / TRACE 问题归因

失败在哪里,如何定位原因?

只有视频结果评分,难以判断问题来自任务规划、素材与输入、内容生成还是后期整合,多层级的 Trace 下钻标签,可以将执行环节与具体问题关联,进一步辅助定位 Agent 执行问题。

DECISION 02 / 为什么建立 Trace 下钻标签?

已被后续环节修正的问题,不重复标注;未修正的问题,追踪其来源。结果评分回答“是否可用”,链路标签回答“问题在哪里”。标签用于辅助人工归因与策略优化,具体原因仍需结合任务上下文分析。

观察到的问题输出结果不符合任务预期
01 / MODEL模型能力生成本身的能力边界
02 / PROMPT & SKILL提示与约束指令表达和 Skill 生效情况
03 / PLANNING任务规划分镜和阶段任务的组织
04 / POST-PROCESS后处理结果处理与交付环节

归因层级为公开方法示意,并非内部 Trace 页面或真实 Case。

05 / 专项验证与版本准入

改动后如何判断是否改善?

问题归因之后,用专项题库验证 Skill 约束、工具编排等策略。评测结果回到版本比较与发版判断中,使优化优先级有依据,而不是只凭单个好坏样例决定。

  1. 01聚焦问题类型从高频问题与问题库确定专项方向
  2. 02验证策略变化观察 Skill 约束和工具编排的效果
  3. 03回到版本判断结合标准与可用门槛评估准入
06 / TRACE 复核方法探索

如何提高问题排查的效率?

Trace 涉及多阶段执行与信息传递,复核时需要结合节点、字段、任务状态和阶段衔接,识别可能的问题线索。规则筛查可以作为辅助思路,将值得关注的记录交由人工进一步分析。

方案探索:将可检查的线索组织为规则,先筛出待复核记录,再结合任务上下文分析。下图展示这一思路的脱敏示意;筛查输出是复核线索,最终归因由人工判断。

TRACE REVIEWMETHOD EXPLORATION
INPUTTrace 节点与阶段记录
节点字段状态阶段传递
OUTPUT问题线索 · 待复核记录
HUMAN REVIEW / 方案示意规则筛查 → 人工复核

本案例基于个人工作经历整理。流程图为公开展示重新绘制,不包含内部评测题库、真实 Trace、具体评分阈值或未公开业务数据。

返回作品集