CASE EXAMPLE / 脱敏构题示意
短剧空间站位与跨镜头一致性
重点验证的能力
检查 Agent 能否理解空间站位参考信息,在多轮任务中继承角色和空间关系,并将约束延续到后续镜头生成。
- 理解站位参考
- 继承角色与空间关系
- 延续至后续镜头
角色站位与跨镜头连续性
观察最终成片是否满足空间关系与连续性要求。
规划、信息引用与素材复用
检查中间规划、参考信息引用及素材复用是否符合任务要求。
依据提供的标签与构题逻辑整理的公开展示示例,不代表原始题目或内部验收细则,也不展示实际测评结果。
CASE 01 / PROFESSIONAL EXPERIENCE
字节跳动 · 视频生成 Agent · 5 个月实习
面向豆包端内创作及方舟 API 短剧生成场景,我参与基于 Seedance 模型的视频生成 Agent 建设,负责推进评测体系建设,聚焦质量评估、问题归因与策略优化,支撑能力上线及版本准入。
短剧和用户创作任务涉及多镜头、多角色与多阶段生成。单看画面观感,难以判断 Agent 是否完成用户意图,也难以说明问题出在模型、规划还是后续处理。
评测首先要明确测什么,再判断输出是否可用、解释问题为什么发生。Benchmark、MOS 与 Trace 分别承担这三层判断,再通过专项验证支持策略优化与版本判断。
策略优化→专项验证→版本判断
让每道题,都能测出具体能力。
我参与的 Benchmark 构建以真实用户任务为起点:通过场景分类定义任务覆盖范围,叠加 Agent 能力标签,明确每道题重点考察什么,再结合输入素材、对话链路和验收标准形成可执行的评测 Case。
通用创作 / 短剧专项
规划 / 记忆 / 工具编排
最终结果 / 执行链路
输入素材 · 用户对话链路 · 关键考点 · 预期结果 · 失败标准
按场景与能力检查覆盖,结合迭代评测、发版评测与专项评测维护题目。
CASE EXAMPLE / 脱敏构题示意
检查 Agent 能否理解空间站位参考信息,在多轮任务中继承角色和空间关系,并将约束延续到后续镜头生成。
观察最终成片是否满足空间关系与连续性要求。
检查中间规划、参考信息引用及素材复用是否符合任务要求。
依据提供的标签与构题逻辑整理的公开展示示例,不代表原始题目或内部验收细则,也不展示实际测评结果。
此前三分档难以有效拉开视频质量差异,我整合评测标准,形成 MOS 五分档及判定依据,支持多版本评测。评分结合整体观感、需求匹配、核心主体,以及音画和字幕对理解的影响。
只有视频结果评分,难以判断问题来自任务规划、素材与输入、内容生成还是后期整合,多层级的 Trace 下钻标签,可以将执行环节与具体问题关联,进一步辅助定位 Agent 执行问题。
已被后续环节修正的问题,不重复标注;未修正的问题,追踪其来源。结果评分回答“是否可用”,链路标签回答“问题在哪里”。标签用于辅助人工归因与策略优化,具体原因仍需结合任务上下文分析。
归因层级为公开方法示意,并非内部 Trace 页面或真实 Case。
问题归因之后,用专项题库验证 Skill 约束、工具编排等策略。评测结果回到版本比较与发版判断中,使优化优先级有依据,而不是只凭单个好坏样例决定。
Trace 涉及多阶段执行与信息传递,复核时需要结合节点、字段、任务状态和阶段衔接,识别可能的问题线索。规则筛查可以作为辅助思路,将值得关注的记录交由人工进一步分析。
方案探索:将可检查的线索组织为规则,先筛出待复核记录,再结合任务上下文分析。下图展示这一思路的脱敏示意;筛查输出是复核线索,最终归因由人工判断。
本案例基于个人工作经历整理。流程图为公开展示重新绘制,不包含内部评测题库、真实 Trace、具体评分阈值或未公开业务数据。
返回作品集