ClaudeMap

SureForge

纯指令式 skill:让 agent 先调研再提问、先规划再动手、先验证再说「做完了」。

技能与命令workflowverificationqualityskillreview

SureForge 把复杂任务的工作规程写成纯文本:四个阶段——调研澄清、规划、执行、交付——每段以一道闸门收尾,结果只有 READY、REPAIR 或 BLOCKED。三档强度按需展开:Light 处理小而可逆的修改;Standard 四道闸门、每道两项互补检查;Full 模式要求 agent 自证三种验证方法、再由一个没看过作者推理过程的新上下文独立评审自由选三种,每道闸门最多三轮评审,轮次耗尽即 BLOCKED 而不是带伤交付。没有运行时、没有 hook、没有依赖——agent 像读其他 skill 一样读它,小任务也保持小(改个错别字不会触发调研立项)。仓库附带真格的评测包:13 个带判定标准的失败场景、20 条带预期档位的激活提示、5 个带隐藏评分标准的合成基准任务。作者的试点记录:GLM-5.2 经 Devin 跑 38 个会话,13 个场景中 12 个完整遵循流程;Grok 4.6 满强度跑 24 次,全部声明档位、评审缺席时如实报告而不是假装查过。

它做什么

  • 四阶段硬闸门(READY / REPAIR / BLOCKED):先调研再提问、先规划再动手、先验证再交付、先独立评审再说完成
  • 三档强度 Light / Standard / Full:改错别字保持轻量,高风险任务每道闸门要 agent 自选三种加评审自选三种验证方法
  • 跳过的问题不算回答:每条发现都要「已确认、有证据反驳、或标记未解决」三选一,然后才许改动
  • 自带评测包——13 个失败场景、20 条激活提示、5 个带隐藏评分的基准任务——外加包测试与变异审计

什么时候用

高风险或难回退的 agent 任务——迁移、删除、发布、安全修复——「agent 说做完了」不够用的地方;以及想要一份成文的分级规程而不是凭感觉的团队。

如何上手

# 用 Skills CLI(Node.js 22.20+),在项目根目录:
npx skills add Da7-Tech/SureForge
npx skills add Da7-Tech/SureForge --agent claude-code -y   # 跳过交互询问

# 手动安装:把整个 skills/sureforge/ 目录(SKILL.md + references/ + assets/)复制到
#   Claude Code:.claude/skills/sureforge/ 或 ~/.claude/skills/sureforge/

# 在仓库根目录验证包本身(Python 3.11+):
python3 -B -m scripts.check_package
python3 -B -m unittest discover -s tests -v

注意事项

纯指令意味着没有强制力:弱模型仍可能跳过闸门——试点测的正是这一点,而非已经解决。已公布的试点用的是小型合成任务,目的是测「遵循度」而不是证明在真实欠规格工作上的收益——README 明说下一步才做真实任务集的三臂对比。Skills CLI 可能写出含本地路径的 skills-lock.json,提交前先看一眼。平台路径在 v1.0.0 时对 Claude Code、Codex、Cursor、Devin、Hermes 验证过——各家的目录会变,装不上先查宿主当前文档。MIT。

代码仓库

Da7-Tech/SureForge

收录日期

地图上的相关资源

  • 归藏的 Agent Skill:把代码库的最近更新做成一支成片宣传片——接真实组件、代码渲染动画、代码写配乐,全程不碰视频剪辑软件。

    • agent-skill
    • video
    • promo
    • marketing
  • 一个给「图里没有任何文字线索」的照片做地理定位的 Agent Skill——用 OSM 几何、高程天际线与卫星瓦片,把「这是哪」变成带误差半径的测量答案。

    • agent-skill
    • geolocation
    • osint
    • openstreetmap
  • Birdview

    技能

    让 AI 编码 agent 在动第一行代码之前先画出架构、声明影响范围的 skill——成果是一张可直接打开的独立 HTML 架构地图。

    • skill
    • architecture
    • code-visualization
    • change-scope