本文提供试点评估框架,指标与验收条件应由双方预先约定,不代表已实现的效率或良率提升。

带入一个已确认的异常案例

带入一个已确认的异常案例,先按当前演示范围评估单片巡查、已有分析解读、引用准确性与复核投入。下一阶段:补齐加工履历,执行来源定位检查;具体检查、执行能力与交付范围需要事先约定。查看当前演示与试点范围。

面向来源定位,客户关心的是:异常来源能定位到哪一层?还缺什么证据?案例需要有明确异常、可访问材料和能够评审结果的工程师。本轮是否能够回答来源问题,取决于已支持的检查与可用工程记录;巡查发现与来源定位应分别评价。

开始前约定数据范围、比较基线、预期交付和时间窗口。预期交付可以是可复现的发现、证据包和下一轮验证计划;发现缺少关键数据,也应被准确记录。

在相同条件下比较

同一数据快照同一工程问题现有分析流程人工操作 · 已有脚本Agent 调查流程观察 · 计算 · 证据工程师评审新增价值与复核成本固定口径 · 记录投入 · 复现发现 · 验证建议
评估设计示意:冻结数据与问题,对照现有流程和 Agent 调查,由工程师评审价值与投入。

使用同一份数据快照和同一个工程问题,按客户真实流程记录取数、比较、判断、交付与投入。WaferPilot 辅助流程执行本轮约定的检查,由工程师复核并处理例外;同样保存步骤、实际交付和完整人工介入。已知答案的历史案例可以用于复现检查;尚未解决的问题,可以用于评估新增线索。

历史答案已经提供给 Agent 时,需要注明。不同任务难度、数据条件和人工支持,也要一起保存,方便解释比较结果。

评价洞察,也评价复核成本

评价项可以记录的证据
定位质量来源判断支持到哪一层:工步、设备、腔室或条件;有哪些支持证据、未排除解释与材料缺口
错误与遗漏按同一标准,由工程师复核错误判断、遗漏的关键检查或证据;无法定位的原因是否被准确记录
结果可复现同一输入、方法和版本能否重现主要计算结果
发现有依据发现是否能回到原图、数据来源和运行记录
调查有增量是否补充有用线索、排除解释或明确关键数据缺口
建议可验证是否形成具体对象、范围和验证步骤
工作量变化人工准备、操作、等待、复核和返工分别花了多少时间

没有试点结果时,展示的是评估方案;有了结果,再报告两种流程的实际差异。效率应按完整工作过程比较,包含数据准备、工程复核和返工。洞察数量需要结合有效性评价;由工程师判断哪些发现值得继续验证。

一次试点应留下什么

  1. 问题与数据说明。输入对象、快照标识、可比条件和已知缺口。
  2. 调查与证据包。按本轮范围保留所用方法、已有科学报告、可用 Pipeline、图像定位和结果口径;缺失材料明确记录。
  3. 工程评审记录。确认了什么,哪些解释仍待验证,复核需要多少投入。
  4. 下一轮计划。继续验证的范围、需要补充的数据,以及适合扩大或收缩的场景。

试点发现、过程效率和实际良率影响,应分别记录。真实工程收益需要相应验证数据支持。

用结果决定下一轮范围

当方法与计算可以复现、发现能够核查、建议有明确验证步骤,并且投入与收益符合约定目标时,可以考虑扩大数据或任务范围。若主要精力仍耗在数据对齐与人工纠错,应先解决这些问题。

对管理者而言,一份好的试点总结能说明:产品在哪类任务上增加了价值、依赖什么条件、还有哪些限制,以及下一轮需要什么资源。

试点目标把“看起来智能”,变成可以评审的工程价值。
了解目标调查体验返回资源与文档