先定义什么叫“做对”
收集成功、失败、边界和恶意输入,明确可接受输出、必须转人工的情况和不允许出现的结果。
输出:样例集 · 预期结果 · 红线表AI 项目越接近真实业务,越需要默认怀疑:先测失败,再谈规模化。

李义把测试、质量、成本和交付复盘放在一起看。服务目标不是把测试写得更复杂,而是让团队在扩大范围之前知道系统在哪些输入、流程和边界条件下会失败。
收集成功、失败、边界和恶意输入,明确可接受输出、必须转人工的情况和不允许出现的结果。
输出:样例集 · 预期结果 · 红线表对输入、工具调用、输出格式和版本变更设置可重复的测试步骤,减少只靠人工点击的验收。
输出:测试脚本 · 输入规范 · 验收清单记录模型、调用次数、失败重试和人工接管,判断优化是换模型、改流程还是减少不必要的调用。
输出:用量表 · 成本估算 · 优化清单将线上反馈、失败样例、用户影响和修复结果归档,形成版本复盘和是否扩展的决策依据。
输出:异常记录 · 版本结论 · 复盘报告准备当前版本、典型输入、预期输出、已知问题和调用记录。首次沟通会先补齐验收口径,再决定做测试集、成本复盘还是上线前评审。
上岸智源实战导师团成员,负责把 Agent 原型拆成测试样例、异常记录、人工接管和版本复盘,帮助团队知道“哪里能用、哪里不能用”。
下面展示的是脱敏服务样本:从客户问题、AI 方案到最终交付物,把服务边界写清楚,便于企业判断是否适合自己的场景。
把原型拆成测试样例,记录异常、人工接管、版本变化和成本,形成上线前检查。
检查资料输入、字段格式、工具调用、输出模板和人工确认点,避免自动化只在理想数据上成立。
通过调用量、上下文长度、模型分层和失败重试记录,找到可以缓存、摘要或缩小范围的环节。
当前页面公开研究主题、服务方法与可复用交付物。正式论文、专著、会议或媒体成果只在取得作者确认和题录后发布。
本页的案例、交付物和相关课程链接,构成目前可以公开核验的 AI 实践材料。
待补充作者确认后的题名、作者顺序、刊物或会议、年份、DOI/链接与授权范围。