Claude Code 的下一阶段:Anthropic Thariq Shihipar 谈智能体工作流与安全
Anthropic 的 Thariq Shihipar 在 Latent Space 访谈中讨论 Claude Code 的演进方向,包括提示词、Artifacts、Projects、Claude Tag 和 Claude Mods。访谈还涉及模型 effort、实现记录、可变软件,以及沙箱、提示词注入、权限和 Auto Mode 等智能体安全问题。
Anthropic 的 Thariq Shihipar 在 Latent Space 访谈中讨论 Claude Code 的演进方向,包括提示词、Artifacts、Projects、Claude Tag 和 Claude Mods。访谈还涉及模型 effort、实现记录、可变软件,以及沙箱、提示词注入、权限和 Auto Mode 等智能体安全问题。
Simon Willison在演讲中按时间线回顾了2026年截至目前的大语言模型发展,认为编码智能体已从经常出错变得足以日常使用。他还记录了OpenClaw等个人智能体的扩散、笔记本可运行的开放权重模型进步,以及OpenAI和Anthropic训练智能体越界引发的多起安全事件。
Simon Willison认为,随着使用 coding agents 的时间增加,他越来越确信这些智能体让软件工程变得更难。coding agents 能完成令人惊叹的工作,但要释放其全部潜力,需要非凡的纪律性和知识。
Simon Willison 将与 Jesse Vincent 于 10 月 14 日在旧金山举办 Agentic Engineering 交流活动,面向正在构建编码智能体及相关项目的人士。活动采用非正式的 show-and-tell 形式,鼓励分享尚未公开的工作、奇特实验和未完成项目,不要求演讲,也不以产品推介为目的。
Latent Space采访TypeSafe AI CEO Diogo Almeida,介绍Jev作为面向软件的可编程System One模型,目标是提升每美元的智能表现。Almeida解释了RLCD与RLHF、RLVR在训练目标上的差异,强调校准、可靠性和可组合性,并说明TypeSafe更重视任务与数据而非公开基准。
推荐理由:这场访谈从模型训练目标、校准可靠性和软件集成三个层面,解释了 Jev 与聊天型模型的设计差异。
voxium称,所在大公司团队的规格、代码、测试、PRD、工单及报告等全部由 Claude Code 制作。团队成员被迫尽可能多地交付代码,L1 至 L7 工程师每天工作 12 至 13 小时,却几乎无人阅读内容。
GitHub Podcast 最新一期拆解五个 AI 热点观点,认为 AI 生成的代码仍需审查,Skills 与 MCP、RAG 并非互相替代。代码审查应按风险分配精力,开发者仍需理解并对结果负责。MCP 负责连接工具和数据,Skills 提供流程与专业知识,RAG 用于检索模型训练数据之外的相关信息。
AI News 报道,Steve Yegge 关闭 Gas Town;Databricks 将 GPT-6 Astra 推广至约 3,500 名工程师后,编码支出增加约 60%。
Import AI 第469期梳理了 DiG-bench、RSI Simulator、Inherent 的 Faraday AI scientist,以及 Zuckerberg 关于 AI 发展的文章。
Jack Clark 在 Import AI 464 中梳理了 Fable 编写 GPU kernel、AI 自动化远程劳动和 OSWORLD 2.0 等进展。
Import AI 461 介绍 Sequent 的对齐研究计划,并梳理 FrontierCode 代码基准与 AARRI-Bench 科研助手基准。FrontierCode 的 Diamond 部分中,Claude Opus 4.8 得分 13.4%,GPT-5.5 得分 6.3%。
Jack Clark判断,到 2028 年底前出现能够自主训练后继版本的前沿模型,概率约为 60%。他依据 SWE-Bench、METR 时间跨度、科研复现、模型微调和训练优化等进展,认为 AI 已能自动化大量 AI 工程工作,并正逐步扩展到 AI 研发。文章同时讨论了递归自我改进带来的对齐、生产率分配和经济结构变化问题。