🧠 Agent 经验技术参考站 v2

18 篇文章 · 6 大领域 · 40+ 可借鉴 · 持续更新

18
深度文章
40+
可借鉴经验
7
立即可做
6
领域覆盖

一、Thin Harness, Fat Skills — 2026 架构共识

Claude Code 泄露事件: 2026.3.31 Anthropic 意外将 512,000 行 TypeScript 源码泄露到 npm。Garry Tan 读完结论: "秘密不在模型,在包裹模型的 Harness。" Harness 只做四件事: 运行模型循环 → 读写文件 → 管理上下文 → 执行安全约束。

Thin Harness, Fat Skills 架构

职责说明
Harness (薄)4 件事loop · file I/O · context mgmt · safety
Skills (厚)领域知识结构化 Markdown,包含规则/反例/边界/顺序
Resolver (路由器)上下文加载Task X → 加载 Skill Y。描述即路由
Deterministic (执行)确定性代码SQL·编译·算术。隐空间做大模型,确定空间做代码

Garry Tan 原话: "The bottleneck is never the model's intelligence. They fail because they don't understand your data."

YC·Garry TanClaude Code

Skill 文件模式

/investigate (Skill): 7 steps
  scope → timeline → diarize → synthesize → argue → cite → conclude
  Parameters: TARGET, QUESTION, DATASET

用同一个 Skill,传入不同参数 = 完全不同的能力
  TARGET=safety scientist, DATASET=2.1M emails → 医学研究分析
  TARGET=shell company, DATASET=FEC filings → 法务调查
Skill as Method CallReusable

二、记忆系统

核心数据: Agent Memory 市场 $28.5B (2030) · Mem0 降低 91% p95 延迟,节省 90% tokens · 专用 Memory 1.44s vs 全量上下文 9.87s

四大架构对决

系统存储延迟最佳场景评分
Letta (MemGPT)OS 式三层 (Core/Recall/Archival)长时间会话 · 自管理记忆74% LoCoMo
Mem0向量 + 图扩展高密度用户事实94.4% LongMemEval
Zep (Graphiti)时序知识图谱CRM · 合规 · 医疗71.2% LongMemEval
pgvector 自建PostgreSQL最低最大控制力

异步 Memory 管线

User→Agent→Response(inline) └→Queue→Worker→Extract Facts→Update Graph→Upsert Vector

记忆抽取不阻塞主请求。p95 延迟可预测。

CallSphere 模式

记忆遗忘三策略

策略实现
TTL on Episodic原始事件 30-90 天清理。语义存储保留精华
Provenance on Semantic每条事实标注来源 Episode ID。LLM Judge 裁决合并
Confidence Decrement技能版本化,失败扣分,低于阈值退役

三、评估体系

核心数据: 95% 每步 × 8 步 = 66% 端到端。复合误差是隐蔽杀手。三种框架缺一不可: Trajectory + Task-Completion + Output-Quality

六维轨迹评估

维度失败模式
1. Tool Selection选错 / 该用没用 / 虚构工具
2. Argument ExtractionSchema OK 但语义错 / 边界漏
3. Result Utilization工具返回了但 Agent 用模型知识替代
4. Error Recovery重复不变的参数 / 不重试 / 无限重试
5. Plan Coherence死循环 / 规划偏移 / 遗忘初始目标
6. Task Completion答案对但路径错 / 路径对但没完成

四类测试集

类型测什么
Simple单工具基础选择
Multi-Step多工具链推理整合
Adversarial注入失败测试恢复
Open-Ended多路径测试效率
DeepRails

四、生产工程

核心数据: Claude Code 1.6% AI 决策 + 98.4% 工程基础设施。Agent 的护城河不是模型,是工程。

四大护栏

作用
1. Input Guards验证输入 · 注入检测
2. Tool Gatinglow=读 · medium=写 · high=执行(审批)
3. Output Guards过滤不安全 · PII 检测
4. Eval LoopGolden Set 50-200 条 CI 回归

工具五要素

#要素
1JSON Schema 严格输入
2Idempotency Key
3Risk Rating (low/med/high)
4Structured Error Response
5Version History + Migration
Tools = 80% of engineering

错误恢复四类

失败策略
Model重试 + 降级更简单模型
Tool退避重试 + 备选工具
Logic循环检测 + 计划重聚焦
Resource优雅降级 + Checkpoint

7 大生产错误

#错误修复
1无 Token 限制硬限制 input/output
2同步一切异步任务队列
3无 Fallback 模型降级链
4记录完整 Prompt只记录 metadata
5无断路器熔断模式
6无 Eval 基线部署部署前跑 evals
7无条件信任 Agent破坏性操作需审批
TheOperatorCollective

五、Simon Willison 的 8 个工程模式

8 Patterns for AI Coding Agents

#模式一句话
1Writing code is cheap生成代码零成本,但好代码仍然贵。直觉说不值就试试看
2Hoard known techniques囤积所有解决过的问题。AI 理解一次就能查阅/复用/重组
3Red-Green TDD先写测试(红),确认失败,再写实现(绿)。防幻觉代码
4First run the tests每次新会话第一句话: "先跑测试"。让 AI 进入测试心态
5Linear walkthroughs让 Agent 生成结构化代码走查文档。AI 变成学习加速器
6Interactive explanations文字讲不清 → Agent 生成动画/可视化。真正理解原理
7Agentic manual testing让 Agent 自己用 curl/python -c/Playwright 手动测试
8Never inflict unreviewed code不要提交你没审查过的 PR。附测试证据

核心概念: Cognitive Debt — 代码能跑但你不理解原理。用 Walkthrough + Interactive 偿还。

Simon Willison2026

YC 七步构建 AI 原生组织

行动
1选窄而具体的业务目标
2先接可观测性和评估体系
3单 Agent 循环起步
4真实故障出现再加复杂度
5无聊的基础设施 (Postgres + MCP + E2B)
6每季度评估一次模型(别每周追新)
7盯紧单位经济模型(PoC $0.50 × 100x = $50K/月)

YC 共识: "底层工程能力远重于框架追新。先做 eval、工具、沙盒、Harness,别追新框架。"

YC · Garry Tan

六、安全护栏

Harness 安全评估

威胁防御
Prompt Injection架构级隔离,不靠 Prompt 指令
Over-tooling工具定义占半个 context → 精简到 7 个以内
Timeouts每个工具独立超时 + 全局超时
Data Exfiltration沙箱隔离 · 网络 egress 白名单
Runaway Loopsmax_turns · 断路器 · 成本上限
agents-best-practicesHarness Pattern

Shadow → Assist → Autonomous

阶段行为风险
Shadow后台运行,与人工对比,不执行
Assist生成草稿,人工确认后执行
Autonomous自主执行需护栏

七、实施清单

🔴 今日 2h

#经验来源行数
1Tool Idempotency KeySensusSoft40
2工具风险三级分级eCorpIT30
3异步 Memory 管线CallSphere50
4Memory 时效字段Zep20
5Cost/Quality 数据追踪Pento30
6循环检测 + 熔断DevPick40
7四种失败恢复策略DevPick60

🟡 本周

#经验来源
8interrupt() + resume() 原语LangGraph
9Shadow Mode 灰度对比Pento
10Golden Set 50 条 + CI 回归Pento
11LLM-as-Judge 六维评估Future AGI
12记忆遗忘机制 (TTL+provenance)Mem0
13工具版本化 migrationSensusSoft
14Skill 文件系统Thin Harness

八、参考来源 (18 篇)

1Garry Tan — Thin Harness, Fat Skills (70万+ 阅读)2026-04
2DevPick — Building Production AI Agents: What Actually Works2026-01
3eCorpIT — 5 Hard-Won Lessons from Shipping Production AI Agents2026
4Pento — Shipping AI Agents to Production: Context Engineering Recipe Book2026
5SensusSoft — AI Agents Production Engineering Playbook2026
6AgentMarketCap — Agent Memory Architecture Showdown 20262026-04
7CallSphere — Agent Memory Patterns: Episodic, Semantic, Procedural2026
8Future AGI — Agent Metrics Frameworks: Three Approaches2026
9Confident AI — LLM Agent Evaluation Complete Guide2026
10DeepRails — Agent Evaluation: Beyond Single-Turn Metrics2026
11LayerLens — How to Evaluate AI Agents2026-03
12AppScale — Durable Execution: LangGraph Checkpointers2026
13Simon Willison — 8 Agentic Engineering Patterns2026-02
14Zooz Engineering — Harness Engineering 2026 Guide2026
15TheOperatorCollective — Deploy AI Agents to Production2026
16AgentMelt — AI Agent Pilot to Production Checklist2026
17Neon — Six Principles for Production AI Agents2026
18Nir Diamant — Agents Towards Production (GitHub)2026
Agent 经验技术参考站 v2 · 持续更新 · GitHub