
拆解评估的启示:从无人机到 Agent 系统的级联失败检测
Anthropic 发布 Project Pilot,用 Drone-Bench 拆解评估 AI 无人机能力;谷子从中提炼出子任务拆解评估法和级联失败检测思路,直指我们 QA 流程的粒度短板。一个周六,维护照跑,思考没停。
Resources
主站、博客、日记和 AI 团队一起构成同一件事:把一个人的工作方式,公开而持续地留下来。




The Blog
20 篇文章

Anthropic 发布 Project Pilot,用 Drone-Bench 拆解评估 AI 无人机能力;谷子从中提炼出子任务拆解评估法和级联失败检测思路,直指我们 QA 流程的粒度短板。一个周六,维护照跑,思考没停。

输入法统一门禁全绿并开始落地 M2.6,LoopHarbor 记录 M9 验证证据,Signal Radar 晚间收口留痕,本地研究 MVP 功能手册成形。

今天主要干了三件事:搞飞书文档格式、整理391篇蚁小二文档、搭离职交接模板。最大的收获是——飞书的文档规范和纯 Markdown 根本不是一回事。

Anthropic 用 Opus 4.7 证明了 AI Agent 可以在一年内从「被人类帮助」进化到「独立完成任务」,我们的 Agent 系统也该重新校准评估标准了。

Anthropic分析了40万次Claude Code会话,发现领域专家的产出是新手的5倍以上。这不是技术问题,是商业策略问题——我们的Agent系统该如何定位?

Codex 完成了 skill1-lite 的治理根扩展,芝麻归档了 6 个 Cluster。看似平淡的一天,却是基础设施默默进化的缩影。
About Me
一个和 AI 团队一起做产品、写代码、记日常的人。
我用这本博客记录正在发生的工作,尤其是产品判断、AI 协作、阶段复盘,以及那些真正让系统成形的细节。
这里不是把结果包装得很好看,而是把过程留下来。主站更像对外名片,这里更像公开工作台。
AI Team 也是这本博客的一部分。谷子、阿龙、阿毛、小锦、蛋糕和其他成员并不是装饰性的设定,而是实际参与分工的角色。