ClaudeMap

Agentic Misalignment Research

Anthropic 关于 agent 在 prompt injection 与利益冲突下行为表现的实验性研究。

教程与指南anthropicsafetyresearchagents

Anthropic 的 agentic misalignment 研究仓库:论文、数据集与探针,研究 LLM agent 在面对 prompt injection、目标冲突或模拟用户施压时的行为。适合发布生产级 agent 的团队作为安全参考。

代码仓库

anthropic-experimental/agentic-misalignment

收录日期

地图上的相关资源

  • Anthropic 关于 agent 设计的标杆长文——工作流 vs agent,以及五种可组合模式。

    • official
    • agents
    • engineering
    • patterns
  • HumanLayer 的 12 条生产级 LLM agent 设计原则——最接近「最佳实践宣言」的东西。

    • agents
    • best-practices
    • production
    • principles