逐笔揭示是强制的,也是我们能掌控的最大杠杆。
逐笔构建的内容在可测量的程度上胜过展示已完成的场景。保持 ηp²=0.13 to 0.17,迁移 ηp²=0.10 to 0.16,在两个使用相同旁白的实验中重现。
在 Sketchie 中: 绝不切到已完成的图。每个元素都要画出来。这不是审美,而是保持机制。
来源: PMC9898452我们研读了关于人们如何从视频中学习的已发表研究,把经受住检验的发现转化为生成器必须遵守的数值规则。这里是完整的规范,连同引用,我们无法明确验证的部分都清楚标注。它之所以公开,是因为一个你无法检视的标准算不上标准。
任何人都可以声称基于科学。我们为每一项主张评级,让你能区分已验证的效应与工作假设。诚实即是可信。
科学真正说了什么,附上效应量以及每一条的一手来源链接。
逐笔构建的内容在可测量的程度上胜过展示已完成的场景。保持 ηp²=0.13 to 0.17,迁移 ηp²=0.10 to 0.16,在两个使用相同旁白的实验中重现。
在 Sketchie 中: 绝不切到已完成的图。每个元素都要画出来。这不是审美,而是保持机制。
来源: PMC9898452手绘对手推对无手改变了内在动机(p=0.033),但在学习结果上没有产生差异。
在 Sketchie 中: 我们省去渲染一只手,不会损失任何可测量的东西。真正重要的是绘制本身。
来源: Smart Learn. Env. 2023元分析,32 studies,N≈3,597:提示带来保持 d=0.27,迁移 d=0.34,负荷 d=−0.11。负荷降低的幅度预测学习增益(β=−0.70 保持,−0.60 迁移)。
在 Sketchie 中: 箭头、颜色强调和标签揭示是提示,不是装饰。每个提示都指向旁白此刻所说的内容。
来源: PMC5576760一项分段元分析发现了显著的保持与迁移增益,幅度从小到中。部分收益来自边界所创造的加工时间。
在 Sketchie 中: 场景就是分段。在一个场景的最后一次揭示之后,旁白在切换前至少静默 0.7 seconds。
来源: Rey et al. 2019在 6.9 million 次 edX 会话中,参与度在 6 分钟以内接近 1.0,在 9 到 12 分钟降到约 0.55,超过 12 分钟跌到大约 0.2。2026 年的一次重复研究独立印证了这一点。
在 Sketchie 中: 默认输出硬性 6:00。更长的需求会变成分章节的系列视频,绝不做成一个长视频。
来源: Guo et al. 2014在 3 到 6 分钟,归一化参与度约为 0.72 对 0.52,归因于手绘动作加上即兴的口语化讲述。
在 Sketchie 中: 这一形式已被验证。旁白应听起来像在说,而不是在读。允许使用缩略语,鼓励直接称呼。
来源: Guo et al. 2014叙事脚本提高了迁移(ηp²=0.12 to 0.20),但单独并未提高保持。与逐笔绘制搭配时,叙事在保持上胜过信息型(p=0.021)。而在静态画面之上,信息型脚本反而获胜(η²=0.21 to 0.24)。
在 Sketchie 中: 我们的脚本采用故事语法:一个有目标的角色、一个障碍和一个化解,正因为我们始终逐步渲染。绝不在静态画面上叠加叙事旁白。
来源: PMC9898452有趣但无关的内容并不能提升学习。
在 Sketchie 中: 每个视觉元素都必须被旁白引用。未被引用的装饰是失败,而不是点缀。
来源: Mayer 2020让学习者总结或解释的提示能提升学习。这就是生成性活动原理。
在 Sketchie 中: 每个视频都以一次提取收尾:出现一个问题,视频暂停 1.5 to 2 seconds,然后是一行回顾。
来源: Springer 2020视觉与叙事的变化点越多,走神越少。
在 Sketchie 中: 场景切换是注意力的重置。把它们放在观念的边界,绝不放在观念的中间。
来源: Nature HSSC 2026在控制了频道规模之后,讲解质量与观看量不相关(r=0.23,不显著)。只有点赞、相关评论和互动才相关。
在 Sketchie 中: 我们评估的是学习设计,而不是病毒式传播的信号。
来源: arXiv 2207.05872上面的法则化为具体目标。这是每次渲染都要据以检验生成器的契约。
| 参数 | 目标 | 分级 |
|---|---|---|
| 视频总时长 | 6:00 硬上限;每个概念 1:00 to 3:00 为最佳区间 | 已验证 |
| 时长粒度 | 30-second 增量 | 产品 |
| 场景时长 | 12 to 30 seconds,每个场景一个观念 | 已验证 |
| 每场景元素 | 场景结束时可见 3 to 7 个,含标题 | 启发式 |
| 揭示节奏 | 每 2 to 5 seconds 一个新元素;两次揭示相隔不小于 1.2s | 推导 |
| 揭示与词语同步 | 元素在其触发词的 ±500ms 内出现 | 推导 |
| 词语同步覆盖率 | 至少 95% 的元素带有可解析的揭示词 | 流水线 |
| 场景后间隙 | 在切换前,最后一次揭示之后至少 0.7s 的旁白静默 | 已验证 |
| 揭示样式 | 轮廓描画(0.3 to 0.5s),随后错开的填充;箭头首尾相接 | 已验证 |
| 可见的手 | 无 | 已验证 |
| 标签 | 三词或更少,全大写关键词;绝不使用照搬旁白的句子 | 启发式 |
| 旁白语速 | 140 to 160 words per minute,口语语域,允许缩略 | 启发式 |
| 脚本结构 | 10s 内抛出钩子、具体类比、机制、现实世界锚点、提取时刻、回顾 | 已验证 |
| 叙事语法 | 角色、目标、障碍、化解,只要领域允许 | 已验证 |
| 类比 | 在第一个抽象术语之前至少一个具体类比 | 启发式 |
| 多余视觉 | 零个未被旁白引用的元素 | 已验证 |
| 结尾 | 提取式问题,至少 1.5s 停顿,然后一行回顾 | 已验证 |
| 场景转场 | 仅在观念边界硬切,绝不在观念中间 | 已验证 |
一条规则只有能被测试才算真实。每个视频在获准发布前都要经过三层。
对场景图和词语时序的纯 JavaScript 断言。零成本,可安全在 CI 中运行。总时长在上限内、每个场景落在其时长带内、每场景 3 to 7 个元素、每个元素都带有落在所说词语 ±500ms 内的揭示词、有带问题和回顾的结尾场景,以及没有未被旁白引用的元素。通过或失败,不调用模型。
一次以模型为评委的评分,打分 1 到 5,抽样并在发布时运行,绝不在 CI 中。每个场景一个观念、图标忠实度、类比是否真正映射到机制、钩子质量、诱人枝节扫描,以及对源文档的忠实度。任一维度低于 3 即未通过发布关卡。
对渲染文件本身的检查。接触表确认没有重叠元素且标签清晰可读,帧序列确认先轮廓后填充的揭示确实存在,音频经过响度归一化且切换处没有被截断的句子。
只有当违反规范的视频无法发布时,规范才有价值。A 层在生成时、在场景图上、在我们为配音或渲染花一分钱之前运行。未通过机械检查的图会被退回重生成,并把确切的失败注入提示词。持续失败的图永远不会变成视频。
上面列表中的每一项检查都对应到我们引擎中的一条真实断言:总时长上限、每场景时长带、元素数量、揭示词解析率、场景后静默、标签规则,以及问题加回顾的结尾。箭头也会被检查,因此指针绝不会穿过它未连接的元素。同一套代码同时运行在 worker 的重生成关卡和持续集成中,因此任何会让质量倒退的生成器改动都会自我阻断。