Demo 都很好看,合同签完才见真章。下面 9 个问题按「踩坑频率」排序,每个问题背后都是一类真实发生过的翻车。
9 个问题
- 「评测集用什么数据建?」——用构造数据跑出的 99% 准确率没有意义。真评测集必须来自你的真实业务样本,尤其是出过错的那部分。
- 「上线门槛是多少,谁签字?」——不能答出具体数字(如「200 条评测通过率 ≥ 95%」)的方案,等于没有验收标准。
- 「项目里工作量最大的是哪部分?」——靠谱的答案通常是知识治理或数据对齐,而不是「调模型」。如果说「模型调试占大头」,说明他还不知道真正的工作在哪。
- 「上线之后模型输出错了,第一响应人是谁?」——问到值班与 SLA。答「有客服群」的基本没做过可运营项目。
- 「坏例怎么收集、多久修一轮?」——上线只是开始。没有坏例回流机制的项目,3 个月后必然退化。
- 「模型厂商换版本,你们怎么办?」——模型 API 升级可能导致效果漂移。要看有没有回归评测与版本锁定策略。
- 「我们的数据存在哪,谁能看到?」——数据边界要在方案里写清:是否出域、是否用于训练、日志保留多久。
- 「项目交接时我们拿到什么?」——评测集、提示词、部署文档、值班手册都应是交付物。只交付源码不交付评测集的项目,你会永远依赖他。
- 「能不能给我们一个做砸的案例?」——敢复盘失败的供应商比只有成功案例的更可信。答案里应有归因和补救过程。
答案里的危险信号
- 「这个我们做过很多次」却拿不出同行业的评测数字。
- 把「准确率 99%」挂在嘴边,但说不出评测集长什么样。
- 报价里没有运维项,却说「系统很稳定不用维护」。
- 拒绝把验收标准写进合同。
常见问题
问这么多会不会把价格问高?
会筛掉低价但不合格的报价,但省下的是翻车重做的双倍成本。好的服务商欢迎这些问题——这正是「按验收交付」和「卖人力」的分界线。
小项目也要问全吗?
可以精简到 4 条:评测数据来源、上线门槛、值班响应、交付物清单。这 4 条守住了,小项目也翻不了车。