00 / Thesis
pstack 是一台工程操作系统,不是一堆提示词。
你的阅读方向是对的。poteto-mode 是控制面。它把任务路由到 playbook,再按步骤打开工序技能。真正要理解的,是它在模拟什么组织,以及为什么用 markdown 就能运转。
为什么它看起来只是 md 文件,却能当架构用
因为运行时不是这些文件。运行时是 Cursor 里那个会被指令约束的模型,外加 Task 子代理、按角色选模型、worktree 隔离、以及「步骤必须进 todo」这种纪律。Markdown 只是把本来存在于人口头上的工程习惯,写成模型每次都会重新读到的契约。
Lauren Tan 的原话大意是:agent 很能干,也很蠢,而且非常可教。它们记不住你说过的话。所以失败模式不是要更多代码,而是要把重复失败编码成结构。规则、技能、工具、长期记忆,是在近似一个不会失忆的团队。
这就是思维层。先让一个代理在一个完整问题上可信:理解、复现、设计、实现、验证、交付。再把它乘以并行。反过来做,仓库会先乱掉。
控制面到底路由什么
不是「把一句话分发给所有 skill」。路由是分类,不是广播。一份请求先被判成一种任务类型,再被拷进该类型的强制步骤。步骤到了,才打开 how、architect、arena 这些工序。
所以你不该在提示词里点菜。你给目标和可检查的完成条件。控制面负责选 SOP。点菜通常会打乱顺序,或丢掉 playbook 本来会保留的检查。
有没有 multi-agent?
有。但不是一个通用多智能体框架。它是四种完全不同的并行模式:委托、竞技、覆盖、对抗评审。外加调查时按子系统或证据源扇出。
有没有 LLM Judge?
有,而且是一等公民。Arena 有跨模型只读 judge。Eval 有盲评 judge。Interrogate 的 lead 是带上下文的终审。Shipping 用独立代理出 verdict。
Eval 怎么建?
专门有一份 Eval playbook。核心不是分数,是对抗观察者效应:候选必须盲跑,prompt 必须像真人任务,chain-following 看它读了哪些文件,不看它自称用了什么原则。
先别抄 44 个技能
pstack 是 Lauren 的风格,外加她在 Cursor 内部反复踩过的坑。你要的不是复刻 crown 图标,而是同一套分层:你的原则、你的任务类型、你的验证表面、你的第二意见。
仓库里的 starter/ 是一份最小可行配方。本站最后一章说明怎么从自己的失败模式长出 stack,而不是从别人的目录反推。