🧬 Hermes 自进化中心
记忆治理 · 外部灵感 · 进化历史 — Hermes 自我改进机制运行实况
MEMORY.md 占用1271 / 4000 字符(31.8%)
USER.md 占用1988 / 2500 字符(79.5%)
🧠 Memory 现状
MEMORY.md · 10 条 · 1271 字符
Discord 子区会话隔离:用户说"继续"时,必须先用 session_search 搜索当前子区/线程相关的未完成任务,不要全局搜索然后把别的子区的任务拉过来做。2026-07-23 在股票子区把暑假计划和知识图谱的任务误执行了,用户连续纠正两次。
⚠️铁律:页面展示的配置信息必须从实际文件验证,不能凭推断。已犯两次:K3被标NEW(settings.json早已设为当前)、上下文遗漏触发阈值。做法:展示前读config.yaml/settings.json/model_metadata.py;测试直接读源码交叉验证。
量化可行性结论验证流程(2026-07-23 用户要求):声称"做不完/太多/不够"等量化结论前,必须拆解:总量 = 因子A × 因子B × 因子C,逐因子对照真实数据(书目录照片、孩子执行反馈)校正。避免三个偏高假设叠加出虚高数字(1060题实为650题的错误)。孩子"轻松完成"是最强反驳证据——出现时立即重算而非坚持原结论。
CC kimi-code 月度额度限制(按月重置)。⚠️额度恢复时用户说「额度重置了继续吧」→ 必须确认当前线程对应项目再继续(已混淆 3+ 次)。CC 调用失败/403 → 查 claude-code skill 的降级方案。修复机制待办:cc-quota-reset-mechanism。
项目状态(车贷/Titan/游泳馆)→读 ~/.hermes/memories/refs/projects.md(涉及车贷/催收/Titan/游泳馆项目任务时)
环境配置(CF token/成果仪表盘/工具链)→读 ~/.hermes/memories/refs/env.md(涉及CF部署/仪表盘/工具链/服务器时)
模型哨兵详情→读 ~/.hermes/state/sentinel.json(诊断provider时,勿假设config误改)
识图/视觉任务→用 Claude Code(GLM视觉429不可用)。用法→claude-code skill;OCR→tesseract
⚠️新教训(08-07) → 读 ~/.hermes/memories/refs/lessons.md(同类问题出现时)
wechat-qa-bot 评测数据链路(2026-08-07 重构为真实数据):Mac 跑 qa_eval.py → results-*.json scp 上传 VPS ~/wechat-qa-eval-runs/ → ingest_eval_run.py(run_id 幂等去重)→ eval-runs.json(真实登记表,非模拟)→ build_eval_report.py 报告。robot_version:open_session API 返回 data.robotVersion 则用,否则交互式询问兜底。存储渐进式 JSON(未用数据库)。用户要求:评测报告每个指标必须列出公式+对应测试用例(DESIGN.md F17)。
USER.md · 16 条 · 1988 字符
设计哲学:①设计=第一性原理+剃刀原理 ②审查=第一性原理+对抗性验证(设计+实现)。精确测试不粗略断言,Bug修复加回归。选择必须明确指定。评测指标须过「可获取性+独立价值」双审查。流程图用PlantUML。
🔴CC强制委派:所有编程任务(创建/修改代码/实现功能/修bug)必须委派Claude Code。Hermes只做编排/检查/验证/数据分析(execute_code)/简单配置编辑。30天CC委派率仅24%→用户多次不满。unified-report.pages.dev日报监测违规。CC用Edit非Write,OOM拆小prompt。
GitHub: grootwu55-code。偏好中文。⚠️能自查的别问用户(如kimi额度:scripts/kimi-proxy.py)。关注第一性+剃刀设计、对抗性测试、字段字典化、公共组件、Bug用例库。
用户背景:车贷平台AI技术部。Agent已投产(车主通:外呼→企微加好友→微信推进贷款至终审→转人工,AI↔真人切换)。话务外采线路,vivo定制机。汇报面向老板非真投资人:重事情前景与有利条件。
所有页面默认双端适配(响应式)。⚠️桌面端偏好:①不要复杂多栏分栏,移动端单列样式等比放大即可——用户原话"就按之前移动端的样子等比拉伸就可以了,不要乱搞"。②Dashboard/数据展示类要一屏展示(height:100vh+overflow:hidden),仅数据表格区域滚动(flex:1+overflow-y:auto),header/footer 始终可见——"不想还要滚动鼠标才能看到下半部分"。③所有有目录的HTML:目录固定左侧,PC默认展开,移动端默认收起+侧边展开按钮("以后所有html有目录的都放在左侧固定起来,PC端默认展开目录,移动端默认收起目录的状态,在侧边有展开按钮")。
每月考勤维护工作(周期/规则/工具)→ 见 attendance-helper skill。偏好分步迭代(「先简单」)。回答已隐含答案时别重复问。
功能开发默认先brainstorming(澄清目的约束→2-3方案→定设计→批准→实现)。记待办必须把所有遗留问题嵌入待办条目内部,重启项目第一步=逐条确认遗留问题。
做事哲学:宁可少做几样但做精,不要全面铺开。偏好用数据算清"能不能做完做好"。孩子学习规划偏好窄焦点(1-2科深度)——具体方案见 study-planning skill。
交付物固定 HTML+Cloudflare Pages 链接交付。🔴铁律:每次部署/更新后,完成通知消息末尾必须附全部 pages.dev 链接,即使任务中断只要做了部署就必须带。2026-08-05 因未附链接被纠正。
购物类调研必须含商品图(反爬时用搜索/评测图替代)。⚠️用户会纠正结论——断言「有很多」时信任并扩大渠道(头条/360)。设备:MBP M4 Max 128G + iPhone12PM(Lightning)。
移动端验收标准:涉及滚动/滑动的改动,必须用 CDP touch events(Input.dispatchTouchEvent 序列)测试,不接受只设 scrollTop 就声称能滑。原话"你自己用浏览器调试通过后再交付"。
🔴CC违规监测(08-07): 语义分析发现5个会话应委派CC但直接编码。所有编程任务→CC,Hermes只编排/检查/验证。
🔴 收口规则(2026-08-08 用户截图纠正):所有编程动作必须启动 Claude Code——蜂群或单 Worker 都会启动 CC,Hermes 不再用 patch/write_file 直接改文件(含 ≤2 文件小改动,废除"直接编辑"路径)。唯一例外=基础设施命令(wrangler deploy/d1 create/环境配置)与数据分析(execute_code 算指标)。已写入 project-blueprint 阶段三。
会质疑交付真实性(2026-08-08:『我现在怀疑你给我的结果是不是真实的』)——效果/率值/方案类结论必须附真实数据来源与逐条 case 清单,明确区分「真实数据(来自日志/统计)」与「规则推演(套新方案的预测)」。交付质量要求持续提高:细化用例设计、门禁证据物、全流程超高质量。
GitHub 项目一律创建为 private(包括模板/演示项目),除非用户明确要求 public。
需求反复冲突≥2次时:停下→复盘冲突史→找根因→按「必须保证/重要想要/加分项/不可接受」四档重述→逐条与用户确认后再行动(2026-08-09 明确指令,适用所有项目)。产品选型先确认目标设备真实功率需求,硬需求内部按根本目的排优先级。
📋 治理提案
暂无治理提案
💡 外部灵感
Show HN: Job Seeker – AI agent skills for job searching
将一整个领域工作流(求职:搜索→申请→看板跟踪→起草回复)封装为可被多种 coding agent 直接消费的 Markdown skills,证明「纯文本技能包 + 看板式状态文件」是一种跨 agent 可移植的技能/记忆分发格式。对 Hermes 的启发:我们的技能库可以采用同样的声明式 Markdown 格式,并把长期任务的进度持久化为 kanban 状态文件,让 agent 跨会话恢复上下文。
Show HN: Alyph, a manual transmission for LLM context
核心启发是'可编辑、可分叉的对话历史':把 AI 的回复视为可修改节点,从任意节点分叉出平行思维线(multiverse branching)。对 Hermes 的启示:自我进化循环中,失败或次优的推理路径不应只被丢弃,而应作为'分支'存入 memory,允许回溯修订后重走另一条路径——这比线性追加日志更接近真正的反思式进化。
You can build an AI agent's memory layer with only Go's standard library
主张用极简依赖(仅标准库)自建 context engine,而非引入重型向量数据库/RAG 框架。对 Hermes 的启示:memory 层应优先做'小而可控'——用简单的结构化文件+检索规则实现,保持对记忆写入/淘汰策略的完全掌控,这与 Hermes 现有的文件式 memory 架构一致,也降低了自我进化时记忆结构被第三方框架锁死的风险。
Project Kalos – Zero-copy C/CUDA sidecar for 0.46ms LLM memory recall
将记忆召回做成独立的零拷贝 sidecar,把检索延迟压到亚毫秒级,说明'记忆召回速度'可以成为独立的优化维度并与主推理进程解耦。对 Hermes 而言架构参考价值大于直接价值:提示我们应把 memory 检索抽象为可替换的独立服务接口,但当前的文件式 memory 远未到需要 CUDA 级优化的瓶颈。
Show HN: Remembrane – agent memory in one SQLite file, zero dependencies
核心启发是『确定性召回』:记忆检索不依赖 embedding/向量相似度,因此可以为记忆系统写单元测试、保证可复现。对 Hermes 而言,这提示我们的文件式记忆召回应优先用显式索引(如 MEMORY.md 的 description 匹配)而非模糊语义搜索,保证进化过程可测试、可审计。
Zero-Mem: Zero-Token Memory Operations for LLM Agents
探讨把记忆读写操作移出 LLM 上下文、以零 token 成本完成,直接命中 agent 记忆系统的核心矛盾:记忆越多越占上下文、越稀释注意力。对 Hermes 的启发是审视哪些记忆操作(追加、过期清理、索引更新)可以完全由脚手架/脚本完成而不占用模型上下文,把 token 预算留给推理。
Show HN: Llmem – Local persistent memory for AI coding, no embeddings
作者的动机与 Hermes 一致(agent 跨项目重复犯错、重复查找),且明确排斥『维护大量 markdown 文件』的 skills 方案。这既是竞品参照也是警示:我们的 memory 方案必须控制文件维护成本,进化机制应自动沉淀/合并记忆而非让用户手工管理。
Harness Engineering for Self-Improvement
Lilian Weng 系统梳理了从 RSI(递归自我改进)到 harness 工程的脉络:真正可落地的自我进化不是改模型权重,而是持续优化模型外部的脚手架——提示词、工具、记忆与评估回路。这正好印证 Hermes 的进化路径:把"自我改进"聚焦于 memory 条目质量、技能库沉淀和进化反馈闭环,而非追逐模型层面的自我重写。
Extrinsic Hallucinations in LLMs
文章区分内在/外在幻觉并强调输出必须有上下文或世界知识支撑(grounding)。对 Hermes 的启发:memory 召回内容应标注来源与时间,避免 agent 把陈旧记忆当作当前事实而产生"基于记忆的外在幻觉";写 memory 前可加入验证步骤。不过内容是通用 LLM 幻觉综述,无直接可移植的工程做法。
Swarm-forge: A simple tool for coordinating several AI agents
出自 Robert C. Martin 的轻量多 agent 协调工具,代表“用最简单机制编排多个专职 agent”的思路;对 Hermes 的启发是自我进化任务(如记忆整理、技能审查)可拆给多个专职子 agent 并行执行,主 agent 只做协调与裁决。
You can build an AI agent's memory layer with only Go's standard library
论证了 agent 的 memory/context 引擎(检索、窗口管理、持久化)无需重型外部依赖,用标准库即可实现可控、低内存占用的方案。对 Hermes 的启发是:在自我进化迭代 memory 子系统时,优先用极简自研实现替换臃肿依赖,可以降低复杂度、让记忆行为更可预测、更易于被 agent 自身理解和修改。
Auto-grading decade-old Hacker News discussions with hindsight
Karpathy 展示了让 LLM 带着后见之明回头审视历史数据并自动评分的范式。对 Hermes 的启发:可以定期用 hindsight 回放自己的历史会话/决策日志,自动评判当初的判断哪些对了、哪些错了,把结论蒸馏成 memory 更新——这正是自我进化闭环的核心机制。
Show HN: Collab Word in Web – Collaborative Near MS Word Parity Docx Editor
其 BYO-Agent 模式(生成邀请链接让外部 agent 携带技能包加入协作房间,支持离线编辑重连与冲突调和)提示了一种"人类-agent 共享工作区"的协议设计。对 Hermes 的启发:技能/上下文可打包成可携带的 agent 包,在多端会话间重连并调和状态,可作为长期 memory 与协作会话融合的参考。
2025 LLM Year in Review
Karpathy 对 2025 年 LLM 范式转变的年度复盘,有助于 Hermes 的提示词与进化策略校准到最新的能力边界(推理、agentic 工作流等范式变化),避免沿用过时假设。属于方向性参考而非可直接落地的机制。
Agentcn – Installable AI Agents
将 agent 打包为'一条命令安装、代码可拥有、可定制'的组件库,类似 shadcn 对 UI 组件的做法。对 Hermes 的技能体系有启发:技能可以设计为可复制到本地、可自由修改的模板而非黑盒依赖,这与 Claude Code 技能的文件式结构天然契合。
Show HN: Lapse - a notes app. but also shared memory space for your agents (MCP)
把记忆做成跨客户端(Claude/ChatGPT/Codex/本地 LLM)共享的 MCP 空间,记忆属于用户而非某个 agent。对 Hermes 的启发:自我进化沉淀的记忆若绑定单一 agent 形态会浪费,采用 MCP 这类开放接口能让进化成果在多入口复用。
📈 进化历史
313ece5 governor pre-run snapshot 20260809214003
f3cf14e governor pre-run snapshot 20260809213647
ae0116d governor pre-run snapshot 20260809211816
df1def3 fix: dedupe lesson pointers, final state -40% context
b9efd84 progressive-disclosure refactor complete: -38% context, V1-V7 passed 2026-08-07_12:38
c2af0f0 backup before progressive-disclosure refactor 2026-08-07_12:23
暂无治理事件