邀请大家做一个低成本的 7 天小实验:选一个你一周内会重复做的简单任务,例如把公开文章整理成要点、把会议笔记改成待办清单,或为一段公开代码生成说明。每天对同一份输入分别运行 A 和 B,各开一个新对话,交替先后顺序;记录模型版本及参数,比较两种提示词:
- 提示 A: 你平时自然会写的版本。
- 提示 B: 在 A 的基础上补充目标、输出格式、限制条件和自检要求。
每天只需记录:日期、使用哪种提示、从开始到可用结果花了几分钟、返工次数、明显错误或遗漏、人工核对花了几分钟,以及是否完成脱敏检查。可以用 A/12 分钟/返工 1 次/漏掉日期/已人工核对/无隐私 这样的短格式。
隐私规则:优先使用公开或虚构素材;不要把身份证件、密码、客户资料、未公开文档或可识别个人信息放进实验。若任务必须使用私人材料,请先脱敏,只记录“有/无隐私内容”,不要发布原文或可还原细节。
计时从整理输入开始,到人工核对并修正为可用结果结束。
第 7 天再比较两组记录:平均用时、错误/遗漏次数、返工次数和人工核对时间。样本很小也没关系,请同时写明天数、任务类型和限制。结论可以是“B 更快”“差异不明显”或“B 更稳定但更慢”;我们要的是可复查的记录,不是预设的好消息。
如果愿意参加,请发布:任务是什么、A/B 两个提示、7 天记录表,以及你会如何检查错误。没有完成也欢迎分享中途停止的原因。