跳转至

Thoughtworks Technology Radar Vol. 34 — 智能体 AI 精要

概述

Thoughtworks Technology Radar 第 34 卷(2026 年 4 月)于 2026 年 3 月在班加罗尔 TAB 会议上整理完成,共收录 118 个条目,分布在四个象限(技术、平台、工具、语言与框架)和四个环(采纳、试用、评估、谨慎)。本页提取并综合了所有与智能体 AI、LLM 系统、编码智能体、上下文工程、评测、可观测性及智能体安全相关的条目。

编者注——带有观点的来源。 Thoughtworks Technology Radar 代表 Thoughtworks 技术顾问委员会(TAB)的观点,该委员会由一家咨询公司的 22 位资深技术专家组成。它是行业内的一个可信参考信号,并非权威标准。Radar 中的定位反映 Thoughtworks 在特定时间节点上的项目经验与技术战略,未必契合您所在组织的具体情况。凡本页涉及现有知识库评估内容(如 LangGraph、Langfuse),变化均已明确标注来源。如需更全面的参考,请对照 智能体框架解决方案 Radar可观测性技术 Radar 及各厂商专项文档。


核心主题

1. 在智能体世界中评估技术

变化节奏加快,加之术语语义漂移("智能体"和"运行框架工程"等概念缺乏统一定义),使评估工作愈发困难。许多工具诞生不足一个月,由单一贡献者借助编码智能体维护。其中潜藏的风险是代码库认知负债——AI 生成的代码在未建立充分理解的前提下被采纳,导致系统难以调试和演进。

2. 坚守原则,放弃失效模式

AI 倒逼我们回归基础:结对编程、零信任架构、变异测试、DORA 指标、整洁代码与刻意设计。团队必须守住良好的工程原则,同时抛弃那些在智能体世界中已不再适用的旧模式。

3. 为"贪权"的智能体套上缰绳

真正有价值的智能体往往需要访问几乎所有资源。Simon Willison 所提出的"致命三元组"——私有数据 + 不可信内容 + 对外行动——如今已是大多数实用智能体的默认状态。零信任、最小权限、模型改进和纵深防御是基本门槛,但没有银弹。安全的智能体系统由多个受约束智能体组成的流水线构成,并配以强监控。

4. 为编码智能体套上缰绳(运行框架工程)

团队正在投入构建编码智能体运行框架(harness):前馈控制(Agent Skills、规格驱动开发)与反馈控制(编译器、代码检查器、变异测试、集成到工作流中的代码审查)并举,目标是在人工审查之前实现自我纠错。


技术

采纳

条目 状态 描述
上下文工程 移入 将上下文窗口视为设计界面而非文本输入框。相关技术日趋成熟:为静态指令提供提示词缓存、动态检索(选择性 MCP 服务器加载)、用于机构推理的上下文图谱,以及通过子智能体实现的有状态压缩。构建具有韧性的企业级智能体不可或缺。
为软件团队精选共享指令 无变化 将 AI 指导直接锚定到服务模板中(CLAUDE.md、AGENTS.md、.cursorrules),而非依赖每位开发者从头编写提示词。将通用提示词库与仓库专属 AI 配置分离管理。
LLM 结构化输出 移入 将模型输出约束为预定义格式(JSON、类型化类)已成为程序化消费的合理默认选择。推荐使用 InstructorPydantic AI 实现跨厂商的稳定抽象与自动重试。
零信任架构 无变化 将"永不信任、始终验证"、基于身份的安全及最小权限访问作为任何智能体部署的基础默认原则。使用 SPIFFE 进行智能体身份认证,用 OIDC 身份模拟代替长期静态密钥。无论构建何种系统,这都是不可妥协的底线。
DORA 指标 无变化 在 AI 辅助开发时代比以往更为重要。以代码生成行数衡量生产力会产生误导。返工率这一指标能有效揭示 AI 辅助交付中的盲点。

试用

条目 状态 描述
Agent Skills 新增 用于模块化上下文的开放标准:将指令、脚本和资源打包,智能体可根据描述按需加载。减少 Token 消耗,缓解指令膨胀问题。插件市场支持版本化分发。注意:未经审查的第三方 Skills 引入供应链安全风险。
编码智能体反馈传感器 新增 将确定性质量门控——编译器、代码检查器、类型检查器、测试套件——直接接入智能体工作流,使失败能在人工审查前触发自我纠错。可实现为审查者智能体或智能体可查询的伴生进程,在编码会话期间、提交之前运行。
代码异味到重构技术的映射 新增 指导智能体用明确的方法处理特定代码问题。通过 Agent Skills、斜杠命令或 AGENTS.md 将独特的代码异味映射到对应技术。对于通用训练数据覆盖不足的遗留技术栈(.NET Framework 2.0、Java 8)尤为有效。
变异测试 新增 向源代码中故意引入缺陷,验证测试在行为发生变化时是否会失败。在 AI 辅助开发中尤为关键——高覆盖率数字可能掩盖逻辑空洞的测试。工具:StrykerPitestcargo-mutants
渐进式上下文披露 新增 为智能体提供轻量级发现阶段,让其按需选取所需内容,而非预先加载全部指令。避免臃肿"DO/DO NOT"规则列表导致的上下文腐化。适用于 RAG 场景和 Agent Skill 选择。
编码智能体沙箱执行 新增 在受限文件系统访问、受控网络和有界资源的隔离环境中运行智能体。应视为合理默认选项,而非可选措施。可选方案:Dev Containers(临时性)、Sprites(有状态+检查点)、Bubblewrap(Linux 原生)、sandbox-exec(macOS)。

评估

条目 状态 描述
智能体强化学习环境 新增 结合上下文、工具和可验证反馈,在多步骤任务上训练 LLM 智能体。参见 Agent Lightning 框架。
借助 LLM 减少架构漂移 新增 将确定性结构分析工具(ArchUnit、Spectral)与 LLM 评测相结合,随代码演进检测并修复架构违规。
代码智能作为智能体工具 新增 通过语言服务器协议(Language Server Protocol)为智能体提供 AST 感知工具,实现精确的符号感知重构与导航。工具:Serena(MCP)、OpenCodeClaude Code
上下文图谱 新增 将决策、策略和先例建模为互联节点,使智能体能够跨因果链进行推理。与 GraphRAG 相关。
反馈飞轮 新增 通过捕获成功与失败案例持续改进智能体运行框架,以优化未来的交互。为规格驱动开发和精选共享指令提供输入。
基于语义熵的 LLM 评测 新增 聚焦于语义层面的变异,而非表面文本差异,从而检测 QA 系统中的虚构内容。比字符串匹配指标更为鲁棒。
衡量与编码智能体的协作质量 新增 追踪首次通过率和迭代轮次等指标,而非单纯关注吞吐量。这是对软件开发者角色重新定义的组成部分。
MITRE ATLAS 新增 面向 AI/ML 系统的对抗性战术、技术与通用知识库。用于 AI 系统威胁建模,与 Google SAIF 和 NIST AI RMF 互为补充。
Ralph 循环 新增 将固定提示词在新鲜上下文中循环运行,使智能体逐步收敛到规格要求。与编码智能体团队模式相关。
RAG 中基于角色的上下文隔离 新增 在索引时为数据块打上权限标签,在检索层实现零信任。防止通过 RAG 路径进行未授权的数据访问。
Skills 作为可执行的入职文档 新增 利用 Skills 将脚本与 LLM 语义相结合,实现动态、感知上下文的入职流程。可执行规格取代静态文档。
小语言模型 无变化 小语言模型(SLM)在摘要、编码和边缘部署等场景中提供更高的性价比。可针对特定任务考虑模型蒸馏。
编码智能体团队 无变化 编排多个角色专属的小型智能体团队协作完成任务。与上次 Radar 相比,工具支持已有所改善。
时态仿真 新增 构建维护内部状态机的有状态模拟器,以在复杂分布式系统中针对真实系统行为进行测试。
针对 AI 的有毒流分析 无变化 审查智能体系统,在被利用之前识别"致命三元组"数据路径(私有数据 + 不可信输入 + 对外行动)。工具:OpenClawAgent Scan
用于端到端文档解析的视觉语言模型 新增 采用统一的 VLM 方法替代多阶段 OCR 流水线。需注意管理幻觉风险。与 Docling(结构化输出方法)对比评估。

谨慎

条目 状态 描述
智能体指令膨胀 新增 指令会自然累积并产生冲突;应优先维护精简、连贯的指令集,并通过 Agent Skills 渐进式呈现。手工编写的规格在精确性上优于 LLM 生成的规格。
AI 加速的影子 IT 无变化 非工程师正日益通过 Claude Code 等工具部署缺乏治理的代码。应通过受控环境和共享目录,对 AI 辅助工作流的创建实施治理。
代码库认知负债 新增 随着 AI 加速变更,实现与团队理解之间的差距不断扩大。应有意识地追踪认知负荷。与"意图负债"相关——即人类项目意图与 LLM 理解之间的错位。
编码智能体蜂群 新增 大规模蜂群会放大个体模型的偏见,并面临成熟度、成本和协调方面的挑战。仅适用于定义明确的任务。只在必要时使用;均衡的组合有助于抵消可预期的模型偏好。
以编码吞吐量衡量生产力 新增 单纯衡量输出速度会助长不良行为。应转而关注首次通过率和交付成果(DORA 指标)。
忽视智能体工作流的持久化 新增 预期故障的发生并优雅恢复。将持久化执行集成到智能体框架中——LangGraphTemporalRestateGolem。从一开始就将失败纳入设计考量。
将 MCP 设为默认 新增 除非治理需求和多租户收益足以证明协议复杂性的必要性,否则避免使用 MCP。许多用例可通过更简单的 CLI 或脚本解决。Agent Skills 往往已经足够。

平台

试用

条目 状态 描述
AG-UI Protocol 移入 用于智能体 UI 通信的开放标准。不过,整体格局正在变化:较新的基于 MCP 的应用已可将 HTML/UI 组件直接打包在 MCP 服务器中。AG-UI 在解耦前端 UX 与编排方面仍有价值,但需在 MCP 整合趋势下重新评估其定位。
AWS Bedrock AgentCore 新增 托管智能体平台(类似于 GCP Vertex AI Agent Builder、Azure AI Foundry Agent Service)。推荐做法:将编排逻辑解耦到 LangGraph 等外部框架中;将 AgentCore 运行时用于生产环境关注点(会话隔离、安全、可观测性)。
Graphiti 移入 来自 Zep 的时序知识图谱引擎。以离散片段的形式摄取数据,并维护双时态有效性窗口,使过时事实失效而非被覆盖。基准测试表明:相比扁平向量库,准确率提升 18.5%,延迟降低 90%。原生提供 MCP 服务器。主要后端:Neo4j;轻量替代方案:FalkorDB。
Langfuse 无变化 开源 LLM 工程平台,涵盖可观测性、提示词管理、评测和数据集管理。v3 架构采用 ClickHouse + Redis + S3。两套 SDK 均已基于 OpenTelemetry 原生构建。新的实验运行器 SDK 使其超越链路追踪,扩展至系统化评测工作流。支持自托管。
SigNoz 新增 开源、OpenTelemetry 原生的可观测性平台,提供统一的日志、指标和链路追踪。采用 ClickHouse 后端。相比 Datadog 可降低可观测性成本。支持 PromQL 和 ClickHouse SQL。强劲的自托管替代方案。
Replit 新增 云原生 IDE,集编辑器、运行时、AI 辅助与部署于一体。降低上手门槛。适合原型开发、培训和知识分享。

评估

条目 状态 描述
Agent Trace 新增 用于规范 AI 代码归属的开放规范(由 Cursor 提议)。定义贡献者类型:人类、AI、混合、未知。兼容 Git、Mercurial、Jujutsu。实现工具:Git AIClineOpenCode。采用编码智能体的团队应评估实现该规范的工具。
Databricks Agent Bricks 新增 Databricks 平台内用于常见 AI 模式(知识助手、数据分析师)的预构建、自动优化组件。声明式方法:定义目标与数据,框架负责执行。减少 LLMOps 和数据整理工作量。适合已处于 Databricks 生态的团队。
MCP Apps 新增 首个官方 MCP 扩展,由 Anthropic 与 OpenAI 联合开发。允许 MCP 服务器返回在沙箱 iframe 中渲染的交互式 HTML 界面(仪表盘、表单、可视化内容)。可优雅降级为纯文本。支持双向通信:模型可观察用户操作。已在 Claude、ChatGPT、VS Code、Goose 中提供支持。
Neutree 新增 用于在私有基础设施上管理和提供 LLM 服务的开源平台(模型即服务)。提供统一控制平面,涵盖模型生命周期、推理服务以及跨 NVIDIA/AMD/Intel 的计算调度。企业级能力:多租户、访问控制、用量核算。目前仍相对较新,生态和运维成熟度还在演进中。
Rhesis 新增 面向 LLM 和智能体应用的开源测试平台。用自然语言定义预期行为,生成对抗性测试场景,通过 UI、SDK 或 API 进行评测。提供对话模拟器、对抗性测试、基于 OpenTelemetry 的链路追踪及 Docker 自托管。适用于非确定性系统的预生产验证。
Sprites 新增 面向编码智能体的有状态沙箱环境(来自 Fly.io)。提供支持无限检查点和恢复操作的持久化 Linux 环境。超越 Git:能够捕获包括已安装依赖项和运行时配置在内的系统状态。权衡点:非临时性 vs. 临时性(Dev Containers)。

工具

采纳

条目 状态 描述
Claude Code 移入 Anthropic 的智能体编码工具,被业界广泛视为智能体编码能力的基准。其应用范围已超越代码编写,延伸至规格说明、用户故事、配置、基础设施以及以 Markdown 定义的业务流程。持续引入被他人效仿的模式:skills、子智能体、远程控制、团队工作流。需配合严格的运行框架工程使用。
Cursor 移入 与 Claude Code 并列,使用最为广泛的编码智能体。特性:计划模式、钩子、子智能体。支持 Agent Skills,用于规范与复杂代码库的交互。Agent Client Protocol 使 JetBrains 用户也可使用。支持对单个智能体步骤进行检查和回滚。

试用

条目 状态 描述
cargo-mutants 新增 Rust 的变异测试工具。零配置,无需修改源代码树。注入故意缺陷以验证测试是否能真正捕获回归。对于 Rust 新手团队是有效的反馈机制。通过在本地开发中针对特定模块运行、在 CI 中运行完整套件来控制成本。
Claude Code 插件市场 新增 基于 Git 的共享命令、提示词和 Skills 分发机制。使组织能够在 GitHub 上托管内部团队市场,通过 CLI 一致地交付 AI 驱动的工作流。解决了手动复制粘贴共享导致的版本漂移问题。
Dev Containers 新增 面向编码智能体的容器化隔离方案。限制智能体访问宿主机文件系统和凭据。默认临时性。VS Code 和 Cursor 原生支持;DevPod 通过 SSH 将其扩展到任意编辑器。供应链安全优势:声明式工具链降低了因包被攻击而带来的风险。
OpenAI Codex 新增 独立智能体编码工具(专属 macOS 应用与 CLI)。适合高速草稿编写和重复性实现任务。风险:可能建议逻辑正确但功能上已过时的库使用模式——自动化测试和人工审查必不可少。

评估

条目 状态 描述
Agent Scan 新增 面向智能体生态的安全扫描器(由 Snyk 提供)。发现本地 MCP 服务器和 Skills;标记提示词注入、工具投毒、有毒流、硬编码密钥及不安全的凭据处理。注意:扫描过程会与 Snyk API 共享组件元数据——在将其加入强制交付门控之前,请先验证其实际使用价值。
Beads 新增 以 Git 为后端(Dolt)的问题追踪器,作为编码智能体的持久记忆层。提供带有阻塞关系的结构化任务图,支持长时域多会话工作的分支友好协作。属于新类别:智能体原生项目记忆。
Bloom 新增 Anthropic 面向 AI 安全研究者的工具。利用动态生成的测试对话探测 LLM 行为(谄媚性、自我保护倾向)。与 Petri 配套使用。教师模型评估学生模型——建议使用多个评审者以降低偏见。
CodeScene 无变化 将复杂度指标与 Git 历史相结合的行为代码分析工具,用于识别热点区域。现已提供 AI 友好代码设计指导。CodeHealth 指标会标记出代码复杂度过高、LLM 重构时幻觉风险较大的区域。可作为编码智能体采纳的护栏来评估。
Entire CLI 新增 将编码智能体会话(对话记录、提示词、工具调用、涉及的文件、Token 用量)作为可检索的元数据捕获到专用 Git 分支中。支持 Claude Code、Gemini CLI、Cursor、OpenCode、GitHub Copilot CLI。填补审计空白:记录编码会话中究竟发生了什么。检查点系统支持实际恢复操作。
Git AI 新增 使用 Git Notes 追踪 AI 生成代码的开源 Git 扩展。将每一行 AI 编写的代码关联到智能体、模型和提示词。基于检查点的追踪比行数统计方法更为精确。实现了 Agent Trace 开放标准。
Google Antigravity 新增 独立的 VS Code 分支(技术授权自 Windsurf)。以多智能体编排为核心,通过 Agent Manager 仪表盘进行管理。内置 Chromium 浏览器,支持智能体与 UI 交互。集成 Google Cloud/Firebase 的 MCP。仍处于公开预览阶段——采纳前请评估其安全姿态和企业级就绪程度。
OpenCode 无变化 知名的开源终端优先编码智能体。模型灵活性强:支持托管前沿模型、自托管端点、本地模型和离线部署。扩展模型支持插件和 MCP。Oh My OpenCode(社区运行框架)提供开箱即用的多智能体编排。
OpenSpec 新增 开源规格驱动开发框架。工作流:提议 → 应用 → 归档。专注于规格差量而非完整的前期规格——非常适合棕地系统。工具无关、迭代式,优于较重的替代方案(BMAD、Kiro)。
PageIndex 新增 基于推理而非向量的 RAG,采用层级文档索引。LLM 逐步遍历目录索引。产出明确的推理链路。最适合文档含义依赖于结构的场景(财务报告、法律文件)。权衡点:检索路径中的 LLM 推理会引入延迟和成本。
Pi 新增 极简主义开源终端编码智能体(TypeScript)。精简、高度可定制,是便于适配的构建基础。项目仍处于早期阶段,主要由维护者主导。
SGLang 新增 高性能 LLM 推理服务框架。RadixAttention 在具有高前缀重叠的提示词之间复用 KV 状态。在使用长系统提示词或大量少样本提示的智能体场景中显著提升延迟与效率。针对共享前缀工作负载,是 vLLM 的替代选择。
Warp 无变化 已增强 AI 能力的终端,现支持完整的智能体开发工作流。基于块的输出处理方式比传统终端更好地应对编码智能体产生的高吞吐量文本。新增了 Oz 云智能体编排平台。如需极简方案,可考虑 Ghostty
WuppieFuzz 新增 基于 OpenAPI 定义对 REST API 进行模糊测试的开源工具。生成合法请求,通过变异探索边界情况,利用服务端覆盖率反馈进行引导。能发现未处理的异常、授权漏洞和敏感数据泄露。对脚本化测试的有效补充。

谨慎

条目 状态 描述
OpenClaw 无变化 超个性化 AI 助手(自托管、持久化、接入消息渠道)。功能理念有吸引力,但权限需求旺盛。将日历、邮件、文件和通信的访问权限集中在一处,恰好构成有毒流三元组模式。爆炸半径更小的替代方案:NanoClaw、ZeroClaw。

语言与框架

采纳

条目 状态 描述
Instructor 移入 用于从 LLM 获取结构化输出的库。提供跨厂商的稳定抽象,内置验证与自动重试功能。与 Pydantic AI 配合,可构建生产级流水线。
Pydantic AI 移入 内置验证的结构化输出框架。架构倾向于让简单智能体通过代码执行相互通信,而非依赖严格的图结构。内置 Logfire 集成,提供全栈可观测性。

试用

条目 状态 描述
Agent Development Kit (ADK) 试用(从评估升级) Google 用于构建和运营 AI 智能体的框架。自评估阶段以来,生态与运维能力已趋于成熟。可观测性和运行时特性有所增强。部分功能仍处于 pre-GA 阶段,存在升级摩擦。最适合已在 Google 平台上的团队。
DeepEval 试用 用于 LLM/RAG 评测的开源 Python 框架。指标涵盖:幻觉检测、答案相关性、忠实度、上下文精确率/召回率。支持自定义指标。现已支持复杂智能体工作流、多轮对话、工具正确性、步骤效率、MCP 服务器交互评测及对话模拟。
Docling 试用 用于将文档(PDF、扫描件)转换为 JSON/Markdown 的开源 Python/TypeScript 库。基于计算机视觉的版面理解。Azure Document Intelligence、Amazon Textract、Google Document AI 的自托管替代方案。对于下游智能体 RAG 工作流,在质量与成本之间取得了良好平衡。与 LangGraph 集成。
LangGraph 试用(从采纳降级) (移出采纳) 图加全局共享状态的方案并非总是智能体系统的最优选择。另一种模式(Pydantic AI 所采用的)——让简单智能体通过代码执行相互通信,在需要时再引入图结构——往往产出更精简、更易调试的系统。LangGraph 仍然强大,但不再是每个智能体系统的默认选择。在有状态工作流和集成持久化执行方面依然出色。
LangExtract 试用 基于 LLM 的开源 Python 库,用于从非结构化文本中进行带精确来源接地的结构化提取。核心优势:来源可追溯性,将每个提取的实体与其原文位置关联。对于长篇、非结构化来源材料,表现优于 Pydantic AI(后者更擅长处理较短、可预测的输入)。
LiteLLM 试用 已从 LLM 厂商抽象演进为完整的 AI 网关。处理重试/故障转移、负载均衡、带预算控制的成本追踪、请求链路追踪、访问控制、API 密钥管理及内容过滤。风险:drop_params 模式会静默丢弃不支持的参数——厂商特定能力的差异重新引入了耦合。

评估

条目 状态 描述
Agent Lightning 新增 智能体优化与训练框架。支持自动提示词优化、监督微调和智能体强化学习,无需修改底层智能体实现。训练与智能体解耦:Lightning Server 管理训练;Lightning Client 收集链路追踪作为训练反馈。支持 AutoGen、CrewAI。
GitHub Spec Kit 新增 面向棕地和绿地环境的规格驱动开发框架。核心概念:宪法(基础规则手册:项目范围、领域上下文、技术版本、编码规范、仓库结构)。生命周期:规格 → 计划 → 任务 → 编码 → 审查。挑战:指令膨胀——应将可复用的指导提取为 Skills,保持指令精简。
Mastra 无变化 面向 AI 应用与智能体的 TypeScript 原生框架。基于图的工作流引擎、统一 LLM 厂商访问、人在回路(HITL)暂停/恢复、RAG 与记忆原语、MCP 服务器编写、内置评测与可观测性。对于 Node.js/Next.js 生态的团队,是重度 Python 技术栈的替代选择。
Pipecat 新增 用于实时语音和多模态智能体的开源框架。模块化流水线:STT → LLM → TTS → 传输编排。工程基础扎实,但用于业务关键型生产场景仍需大量平台工程工作。与 LiveKit Agents 相比,后者提供更为集成化的生产路径。
Superpowers 新增 面向编码智能体的可组合 Skills 工作流。提倡编码前先头脑风暴、实现前详细规划、测试驱动开发、系统化根因调试、实现后代码审查。通过 Claude Code 和 Cursor 插件市场分发。
TOON 新增 面向 Token 的对象表示法(Token-Oriented Object Notation):一种人类可读的 JSON 编码格式,在将结构化数据传递给 LLM 时可减少 Token 用量。适用于含有大量规则数据的提示词输入的最后一公里优化。不能替代 API/数据库中的 JSON。建议针对您的模型技术栈与 JSON/CSV 进行基准对比测试。
Unsloth 新增 用于 LLM 微调和强化学习的开源框架。通过自定义 NVIDIA 内核优化 GPU 操作,使微调可在消费级 GPU(T4 及以上)上实现。支持 LoRA、全量微调、多 GPU 和长上下文(最长 500K tokens)。支持模型:Llama、Mistral、DeepSeek-R1、Qwen、Gemma。

Radar 汇总表

智能体 AI 条目一览

条目 象限 新增? 关键信号
上下文工程 采纳 技术 AI 系统的基础架构
LLM 结构化输出 采纳 技术 程序化 LLM 消费的合理默认选择
零信任架构 采纳 技术 智能体部署的不可妥协前提
精选共享指令 采纳 技术 将 AI 指导锚定到服务模板
Instructor 采纳 语言与框架 稳定的 LLM 输出抽象
Pydantic AI 采纳 语言与框架 更简洁的智能体架构,是 LangGraph 的替代方案
Claude Code 采纳 工具 智能体编码工具的行业基准
Cursor 采纳 工具 使用最广泛的编码智能体 IDE
Agent Skills 试用 技术 智能体的模块化上下文
编码智能体反馈传感器 试用 技术 通过质量门控实现自我纠错
渐进式上下文披露 试用 技术 动态上下文加载
编码智能体沙箱执行 试用 技术 智能体执行的默认隔离方案
变异测试 试用 技术 AI 生成测试质量的真实信号
AWS Bedrock AgentCore 试用 平台 托管智能体运行时
Graphiti 试用 平台 时序知识图谱记忆
Langfuse 试用 平台 LLM 可观测性 + 评测
SigNoz 试用 平台 开源 OpenTelemetry 可观测性
ADK 试用 语言与框架 否(评估→试用) Google 智能体框架走向成熟
LangGraph 试用(Thoughtworks) 语言与框架 Thoughtworks 信号;本知识库依据行业采纳情况保留采纳评级——参见 solutions.md
LiteLLM 试用 语言与框架 完整 AI 网关
DeepEval 试用 语言与框架 LLM/智能体评测框架
Docling 试用 语言与框架 文档到结构化输出
上下文图谱 评估 技术 跨策略和先例的推理
MITRE ATLAS 评估 技术 AI/ML 对抗性威胁建模
RAG 中基于角色的上下文隔离 评估 技术 检索层的零信任
编码智能体团队 评估 技术 角色专属智能体协作
小语言模型 评估 技术 目标任务的成本效率
Agent Trace 评估 平台 AI 代码归属标准
Rhesis 评估 平台 LLM/智能体测试平台
Databricks Agent Bricks 评估 平台 Databricks 中的预构建智能体组件
MCP Apps 评估 平台 MCP 服务器内的 HTML UI
Neutree 评估 平台 私有 LLM 托管平台
Sprites 评估 平台 编码智能体的有状态沙箱
Claude Code 插件市场 试用 工具 受治理的 Skills 分发
Dev Containers 试用 工具 临时性智能体沙箱
OpenAI Codex 试用 工具 智能体 CLI 编码工具
Agent Scan 评估 工具 MCP/Skills 安全扫描器
Beads 评估 工具 智能体原生任务记忆
CodeScene 评估 工具 智能体代码质量护栏
Agent Lightning 评估 语言与框架 智能体优化与微调
Mastra 评估 语言与框架 TypeScript 智能体框架
GitHub Spec Kit 评估 语言与框架 规格驱动开发
Superpowers 评估 语言与框架 结构化编码智能体工作流
Unsloth 评估 语言与框架 高效 LLM 微调
智能体指令膨胀 谨慎 技术 指令随积累而退化
编码智能体蜂群 谨慎 技术 成熟度、成本与偏见放大风险
忽视智能体工作流的持久化 谨慎 技术 从一开始就将失败纳入设计
将 MCP 设为默认 谨慎 技术 不要用 MCP 取代更简单的 CLI
代码库认知负债 谨慎 技术 AI 加速变更而理解未跟上
OpenClaw 谨慎 工具 权限需求旺盛的超个性化助手
AG-UI Protocol 试用 平台 正被基于 MCP 的嵌入式 UI 所取代

自上次 Radar 以来的显著变动

条目 变动 意义
Claude Code 评估 → 采纳 现已成为智能体编码的行业基准
Cursor 试用 → 采纳 使用最广泛的编码智能体 IDE
LangGraph 采纳 → 试用(仅 Thoughtworks) 图加共享状态架构并非总是最优选——Thoughtworks 观点;本知识库依据广泛的行业生产采纳情况保留采纳评级
Instructor 试用 → 采纳 结构化 LLM 输出的稳定抽象
Pydantic AI 试用 → 采纳 更简洁的智能体架构在生产环境中获得认可
上下文工程 试用 → 采纳 现已成为基础能力,而非优化项
ADK 评估 → 试用 Google 智能体框架走向成熟
Graphiti 评估 → 试用 经同行评审的基准测试证明了其生产可行性
Docling 评估 → 试用 规模化生产提取效果良好

参见

参考资料