加示例反而更差?LifeOS Science 技能把科学方法变成可执行的排障与实验循环
加示例反而更差LifeOS Science 技能把科学方法变成可执行的排障与实验循环【免费下载链接】LifeOS⛰️ LifeOS — The universal AI Harness designed to move you from Current to Ideal state in both life and work.项目地址: https://gitcode.com/GitHub_Trending/pe/LifeOS你大概率干过这种事提示词输出忽好忽坏你心想加两个示例总不会错改完一看——分数反而比不加低。LifeOS 仓库里的 Science 技能里就有这么一组真实数据6 个提示词变体里组合约束以 88% 跑赢加 few-shot 示例的 85%。直觉这次输了而且输得很体面。这就是 Science 技能想解决的问题把凭感觉改两下换成一条目标-假设-实验循环让从 5 分钟排障到 2 周 A/B 实验都能走同一套动作。先画一张图目标-假设-实验循环长什么样整个技能就一圈循环SKILL.md 里原样印着GOAL 成功长什么样写下来不许脑补 ↓ OBSERVE 现在是什么状态 ↓ HYPOTHESIZE 什么可能管用★ 铁律最少 3 条单条假设自我印证 ↓ EXPERIMENT 设计一个能失败的测试跑掉它 ↓ MEASURE 记下数字没有基线的数据不算数 ↓ ANALYZE 和 GOAL 对比不是和你的希望对比 ↓ ITERATE 回到 HYPOTHESIZE再来一圈注意 ★ 的位置假设必须复数。这一条贯穿后面所有尺度也是整个循环里最容易偷懒、也最容易被偷懒毁掉的一步。三条铁律目标先行、假设复数、诚实测量铁律反面教材正面做法 目标先行让它更快一点——快一点没有验收标准加载时间从 3s 压到 1s——写下来再碰键盘 假设必须复数只验证你心里那条路测完宣布验证成功先列 3 条以上每条标注什么证据能证伪它 诚实测量感觉比之前顺了——感觉不产生结论基线 40% → 结果 36%变化 4ppp0.0003反面教材的共同点是你省掉的那一步会在后面以翻倍的工时代价还回来。按尺度选工作流分钟级、小时级、周级各走几步分钟级问题先列 3 条假设再动手什么时候用明显修复试过没效你正准备随便试几把嘴里冒出应该是 XX 吧但没有证据问题耗时超出预期。什么时候别用反触发修复显而易见、5 分钟内能完这模式你已解决过 50 次以上你还在创造性头脑风暴——这些场景走流程纯属仪式。拿登录接口 500走一遍。目标一句话用户能登录不再 500。 60 秒列假设H1 数据库连接、H2 昨晚发版、H3 认证服务挂了、H4 限流触发。按验证成本 × 命中概率排序先跑最便宜的$ psql -c SELECT 1 # 连接超时 $ docker ps | grep postgres # 空的——容器停了docker-compose up -d postgrescurl -I /api/login返回 200收工。前后 5 分钟对照重启→换浏览器→翻文档的随机试探那套通常是 30 分钟起步。TDD 的红绿重构是同一个循环穿了编码的马甲Protocol.md 给了逐字段映射goal: 测试断言先定义预期行为 observe: 跑一次测试看它失败 hypothesize: 列出实现方案示例正则 / 引库 / 手写解析3 选 1 experiment: 写最少代码让它变绿 measure: 再跑测试 看覆盖率 iterate: 全绿→重构或下一个特性示例里isValidEmail走简单正则6 个测试全过、覆盖率 100%正则方案确认够用。关键点RED先写失败测试逼你把目标钉死在动手之前边写边想、写出来就算对从机制上就被堵死了。小时到天A/B 实验与提示词评测都靠对照组购物车弃购率 40%要压到 25% 以下还附加两条不许变差转化率不回退、投诉不增加——这就是预注册标准写在跑实验之前。四条假设按测试成本排序成本最高的砍结账步骤排最后假设改动测试成本H1加安全徽章低H4显眼的优惠券框低H3移动端优化中H2结账 4 步砍到 2 步高第一轮只动 H1对照组 vs 实验组每组 5,000 人跑 7 天组别弃购率显著性对照组现有流程40.0%—实验组安全徽章36.0%p0.0003然后 H1 → H4 → H3 逐轮叠加每轮只改一个变量每一分改善都能归因阶段基线 → 结果起点基线40%安全徽章40% → 36%优惠券框36% → 32%移动端优化32% → 24%24% 25%达成。别学一次性把四个改动全上线——那时你分不清功劳是谁的。提示词评测是 Meso 尺度的另一副面孔Workflows/ 之外它直接委托给 Evals 技能变体综合得分对照组基线62%长度约束68%格式约束72%要点指引78%组合约束88% ← 胜出Few-shot 示例85%基线 62% 起步最后靠加执行约束拉到 93%。注意那条反直觉结论——组合约束 88% few-shot 85%——正是对照实验给你的而不是加示例肯定更稳的脑补给你的。Protocol.md 对此只有一句提示词实验直接走 Evals句号。 临时搭的评测撑不过第三轮就开始骗你。周级MVP 验证靠文档化撑住周期成本产品级验证跨周口头目标会被两周的噪音冲掉。做法是把目标、假设、实验标准全部落成文档、做全局登记PMF 指标提前承诺。宏尺度慢所以每一步都要留痕。尺度×协议总览什么时候显式、什么时候隐式尺度周期适用场景协议显式度配套模板Micro秒~分钟快速 Debug、TDD 红绿重构隐式脑内过一遍不落状态假设快速版Templates.mdMeso小时~天功能 A/B、提示词评测显式卡住才落文档状态放.science/实验模板PRE-COMMITTED 成功/失败/不确定三态Macro周~月产品 MVP 验证正式文档化 全局登记目标模板含 Minimum/Target/Stretch 三层阈值原则就一句别给 5 分钟的问题上两周的仪式。四类模板目标/假设/实验/结果都在 Templates.md每类带一个快速版抄下来改三个字就能用。收工与升级什么算解决什么信号该上更重的手段算解决预写的成功标准逐条打勾不是差不多且数字能复述——基线多少、结果多少、变化多少。只够到 Minimum 阈值也收工上线让生产环境教下一课。无限实验本身就是反模式。升级触发器清单 QuickDiagnosis 满 15 分钟没结论 → 升 StructuredInvestigation 问题横跨多系统或两人对根因说法不一 → 同上 跨天/跨周、要给干系人审阅、结论要对外发布、需要统计严谨 → 升 FullCycle功率分析、执行审计、敏感性分析都在这层补上 碰提示词 → 直接 Evals不自己手搓 评测连续 3 轮无改进 → 触发范式检查先怀疑用例定义和测量对象再怀疑提示词写在最后方法不神秘知道要什么、现在在哪、哪条路可能通、试最便宜的那条、看数字、对照目标、再来一轮。从 5 分钟的 500 排障到 2 周的功能实验规模在变循环没变。要写正式一点的时候翻 Templates.md 把四类模板抄出来再对照 Workflows/QuickDiagnosis.md 把触发和反触发条件贴在屏幕边上。【免费下载链接】LifeOS⛰️ LifeOS — The universal AI Harness designed to move you from Current to Ideal state in both life and work.项目地址: https://gitcode.com/GitHub_Trending/pe/LifeOS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考