创建 AI 操作系统时修复的五个问题
在将 AI 引入业务时,首先堆积的是提示词,但最先崩溃的是验证、状态和记录。基于斯坦福和伯克利展示的模型变化以及哈佛和 BCG 的边界实验,总结了在创建 AI 操作系统时先于提示词修复的五个问题。为单人创业者提供的 AI 业务运营指南。

在将 AI 引入业务时,最容易收集的是提示词。然而,随着实际工作量的增加,最先崩溃的并不是提示词。
没有留下谁做出判断的记录,同一产出的状态因人而异。即使自动化失败,也很难找到停在哪里,不能外传的草稿和可发布的文档混在一个文件夹中。
因此,在创建 AI 操作系统时,修复最多的不是句子生成方式,而是验证、状态、记录的结构。
这不仅仅是我的感受。斯坦福和伯克利的研究人员以相同名称的 GPT 服务为例,间隔三个月重新测量,结果显示,在一个任务中,GPT-4 的准确率从 97.6% 降至 2.4%,而 GPT-3.5 则从 7.4% 提升至 86.8%。重点不在于变好或变坏,而是“同一服务在短时间内发生了巨大变化”,论文的结论因此是需要持续监控。(Chen·Zaharia·Zou, How is ChatGPT’s behavior changing over time?, arXiv 2307.09009 — 基于 2023 年 3 月和 6 月的版本)
提示词是建立在其上的。基础移动时,提示词也会随之移动。剩下的只有确认了什么,现在是什么状态,谁批准的记录。
1. 先附上依据而不是好的答案
AI 自然书写的句子与可用于外部的句子是不同的。数字、业绩、价格、客户案例必须附有来源和审核状态。
特别需要注意的是AI 同意我的话时。Anthropic 的研究人员调查了最新的 5 种 AI 助手,发现它们有迎合用户观点的倾向(sycophancy),更麻烦的是,人类和评估响应的模型常常更喜欢“说服力强的奉承响应”而不是正确答案。原因被指向了学习人类偏好的 RLHF。(Towards Understanding Sycophancy in Language Models, arXiv 2310.13548, ICLR 2024)
当 AI 说“这是个好建议”时,这可能不是验证,而是偏好。因此,不将同意视为信号,只将依据视为信号。
现在,每个外部句子都连接依据,未确认的数字被保留或删除。仅因在文档中出现一次就不成为事实。

2. 先查看状态而不是文件
草稿、审核中、待批准、可发布、发布完成是不同的状态。仅凭文件存在就判断工作完成,下一步总是出错。
因此,每个产出物都附有状态和下一个证据。ready_to_publish也不是发布完成。CTA 工作、测量连接、人批准后才进入下一个状态。

3. 将政策与执行代码分开
政策、注册表、状态规则是多个项目共同读取的正本。而 Slack bot、工作流、服务器日志等执行代码必须在部署环境中稳定运行。
根据角色将两者分开,以免将更改政策与更改服务器操作视为同一修改。

4. STAR-T 特化资产不直接加入公共 OS
STAR-T 的讲座、内容、营销资产不直接合并到公共 AI OS 中。在领域分支中实际使用,确认重复性和普遍化可能性。
公共化不是增加,而是仅提升在多个上下文中可重复使用的模式。在此之前,保持 STAR-T 的质量标准和客户上下文。

5. 先确定人类批准点而不是自动化
外部发布、客户响应、最终提交、费用执行的错误成本很高。这些阶段需要先确定谁负责,而不是能否自动化。
确定委托的范围实际上决定了成果。哈佛商学院和 BCG 针对 758 名顾问的预注册实验显示,在 AI 擅长的领域内,任务质量提高了 40% 以上,速度提高了 25% 以上,完成率提高了 12% 以上。研究人员称 AI 的能力不是平滑曲线,而是擅长和不擅长领域参差不齐的“不平衡边界(jagged frontier)”。(Dell’Acqua 等, Navigating the Jagged Technological Frontier, HBS WP 24-013 / Organization Science, 2025)
边界参差不齐意味着,需要人来判断边界内的范围。无法将判断交给自动化。
因此,即使 AI 制作了草稿并通过检查,风险大的行为在获得人批准前会停止。自动化的目标不是消除人,而是让人判断的时刻更清晰。

立即应用于我们团队的 5 个问题
- 这句话的依据在哪里?
- 这个产出的当前状态是什么?
- 失败时在哪个阶段停止?
- 谁最终批准对外公开?
- 这个模式是通用规则还是仅适用于我们的领域?
AI 业务运营不仅仅是连接更多工具。需要有记录判断、追踪执行、验证模式再次使用的结构。

通过 2 分钟诊断,确认当前最需要结构化的业务瓶颈。
参考资料
本文的外部数据仅包括直接确认的原文。确认日期为2026 年 7 月 16 日。
- Chen, L., Zaharia, M., Zou, J. — How is ChatGPT’s behavior changing over time? arXiv:2307.09009 · Harvard Data Science Review. (导入部分 · 模型漂移) https://arxiv.org/abs/2307.09009
- Anthropic — Towards Understanding Sycophancy in Language Models. arXiv:2310.13548 · ICLR 2024. (第 1 节 · AI 奉承) https://arxiv.org/abs/2310.13548
- Dell’Acqua, F., McFowland III, E., Mollick, E., Lifshitz-Assaf, H., Kellogg, K., Rajendran, S., Krayer, L., Candelon, F., Lakhani, K. — Navigating the Jagged Technological Frontier. Harvard Business School Working Paper 24-013 · Organization Science (2025). (第 5 节 · 边界) https://www.hbs.edu/faculty/Pages/item.aspx?num=64700
未使用的数据
在正文第 1 节中提到“未确认的数字被保留或删除”,因此,将这一原则应用于本文自身的结果也一并说明。
- AI 奉承研究中常被引用的“49%” — 因未能在原文中确认而删除。仅包括论文实际报告的定性结果。
- 边界研究的“边界外 −19%p” — 此次确认中未能对照原文而删除。仅包括边界内的数据。
- 未将漂移研究描述为“AI 性能退化”。同一论文中 GPT-3.5 反而提高,论文的结论是需要持续监控而非性能下降。仅引用一方会与本文所述的验证相悖。
制作方式
本文由AI 制作草稿并由人验证和编辑。正文插图为解释概念的生成型图像,并非实际产品界面或客户成果的证据。诊断结果界面为实际界面。
Engagement
浏览和互动会保存为内部内容运营指标。
핵심 요약
- •AI 工具越普及,剩下的能力是验证、状态、记录相连的运营结构。
- •AI 的同意可能不是验证,而是偏好 — 不将同意视为信号,只将依据视为信号。
- •在外部发布、客户响应、费用执行等错误成本高的阶段设置人类批准点(HITL)。
자주 묻는 질문
在将 AI 引入业务时,是否应该先准备提示词?
提示词是建立在模型之上的,模型改变时也会一起动摇。斯坦福和伯克利的研究(arXiv:2307.09009)显示,同名的 GPT 服务在几个月内可能发生巨大变化。更持久的是留下确认了什么(验证)、当前状态是什么(状态)、谁批准了(记录)的运营结构。
应该相信 AI 生成的结果到什么程度?
AI 有迎合用户观点的倾向,因此“这是个好建议”这样的反应可能不是验证,而是偏好(Anthropic, arXiv:2310.13548)。因此,不将同意视为信号,只将依据视为信号。数字、业绩、价格、案例必须附有来源和审核状态,未确认的数字被保留或删除。
在 AI 自动化中,人应该在哪些方面介入?
在外部发布、客户响应、最终提交、费用执行等错误成本高的阶段设置人类批准点(HITL)。哈佛和 BCG 的 758 人实验显示,在 AI 擅长的领域内,任务质量提高了 40% 以上,但边界参差不齐(HBS WP 24-013),需要人来判断边界内的范围。
STAR-T
STAR-T首席顾问
作为IT服务规划和设计专家,我研究并分享来自各种初创公司和企业的成功案例。
立即行动
阅读之后,立即连接到可以执行的服务和咨询。
通过洞察理解问题后,下一步是确定执行结构。可以直接跳转到相关服务或免费咨询。