跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 101–120 条 · 共 122 条
5月6日周三
  1. Google DeepMind68

    Google DeepMind 展示 AlphaEvolve 在多领域扩展应用

    Google DeepMind 发布报告称,Gemini 驱动的编码智能体 AlphaEvolve 已从试点工具扩展为 Google 基础设施的核心组件,并用于商业场景。

    推荐理由:文章集中展示 AlphaEvolve 在科研、基础设施和商业场景中的应用,用具体指标说明算法优化能力如何迁移到不同领域。

4月30日周四
  1. Google DeepMind73

    Google DeepMind 启动 AI co-clinician 医疗智能体研究计划

    Google DeepMind 宣布 AI co-clinician 医疗智能体研究计划,探索在医生监督下辅助患者护理并增强临床团队能力。在98个真实感初级保健问题中,该系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。

    推荐理由:文章结合临床证据评估、实时多模态模拟和双智能体安全架构,呈现了医疗智能体的应用边界与研究路径。

4月27日周一
  1. Mistral AI75

    Mistral AI 发布 Workflows 公测版,支持企业 AI 流程编排

    Mistral AI 发布 Workflows 公测版,将企业 AI 流程的持久执行、可观测性和容错能力整合到 Studio 中。开发者可用 Python 编写工作流,业务团队从 Le Chat 触发;v3.0 Python SDK 已公开,可通过 `uv add mistralai-workflows` 安装。

    推荐理由:原文展示了 Workflows 如何把持久执行、可观测性和人工审批整合进企业 AI 流程,并给出 Python SDK 的接入方式。

4月22日周三
4月9日周四
  1. Google Research64

    ConvApparel:Google Research 评估并缩小用户模拟器的真实性差距

    Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。

    推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。

4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四种规模,面向高级推理与智能体工作流。

    推荐理由:文章同时交代四种规模、MoE 激活参数量、端侧离线能力与 Apache 2.0 授权,便于比较部署和微调选择。

3月31日周二
  1. Mistral AI73

    Mistral AI 介绍面向人类与智能体的 Spaces CLI

    Mistral AI 介绍 Spaces CLI,它可通过 `spaces init`、`spaces dev` 等命令搭建多服务项目,并生成配置文件与 Dockerfiles。为支持编码智能体,Spaces 为交互输入提供 flag 等价方式,使用插件注册表返回结构化数据,并在项目初始化时生成 context.json 和 AGENTS.md;文中示例从提示到部署耗时不到 10 分钟。

    推荐理由:文章将交互输入、显式状态和结构化上下文落到 CLI 设计中,给面向智能体的开发工具提供了可复用的实现思路。

3月25日周三
  1. Google Research73

    Google 发布 Vibe Coding XR,用 Gemini 和 XR Blocks 加速 Android XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 与基于 Web 的 XR Blocks,将自然语言直接转化为 physics-aware Android XR 应用,生成时间可低于 60 seconds。

    推荐理由:文章展示了 Gemini 与 XR Blocks 如何把自然语言转成 physics-aware Android XR 应用,并介绍 VCXR60、Pro Mode 和 11 次迭代带来的评测线索。

3月24日周二
  1. Mistral AI75

    Mistral AI 发布 Voxtral TTS 多语言语音生成模型

    Mistral AI 发布 4B 参数的 Voxtral TTS,支持英语、法语、德语等 9 种语言,提供低延迟、情感化语音生成和声音适配。模型延迟可达 70ms,API 价格为 $0.016 per 1k characters,并可在 Mistral Studio 和 Le Chat 中试用。

    推荐理由:文章同时呈现了 Voxtral TTS 的多语言语音能力、延迟与价格,并提供了与 ElevenLabs 模型的对比信息。

3月18日周三
  1. Google Research64

    Google Research 在 The Check Up 展示 AI 从医疗创新走向真实护理场景

    Google Research 在 The Check Up 总结其 AI 医疗研究,覆盖个性化健康、临床协作、公共卫生和生物医学发现。研究系统识别出此前漏检的 25%“间隔癌症”,糖尿病视网膜病变筛查已覆盖一百多万人;MedGemma、AMIE 等系统也在推进临床研究和医疗应用。

    推荐理由:文章串联了个性化医疗、临床协作、公共卫生和生物医学发现中的多个案例,呈现 Google Research 将 AI 推向医疗场景的路径。

3月17日周二
3月11日周三
  1. Mistral AI61

    Mistral AI 如何构建自动生成 Rails 测试的智能体

    Mistral AI 基于开源编码助手 Vibe 构建了一个自动生成和改进 Rails RSpec 测试的智能体,可读取源文件、执行测试并通过 RuboCop 和 SimpleCov 自我校正。该智能体处理了 275 个源文件,测试通过率和平均代码覆盖率均为 100%,RuboCop 违规数为 0,LLM-as-a-judge 得分为 0.74。

    推荐理由:文章拆解了用 AGENTS.md、分类技能和自定义工具约束智能体生成测试的做法,并给出真实代码库中的量化结果。

1月28日周三
  1. Mistral AI79

    Mistral AI 发布终端编码智能体 Mistral Vibe 2.0

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。Mistral Vibe 2.0 面向 Le Chat Pro 和 Team 计划开放,支持按量付费或 BYOK;Devstral 2 转为付费 API 访问,输入价格为 $0.40/M tokens,输出价格为 $2.00/M tokens。

    推荐理由:Mistral Vibe 2.0 将子智能体、澄清选项和斜杠命令技能纳入终端编码工作流,适合了解智能体可配置性的开发者参考。

12月9日周二
10月24日周五
  1. Mistral AI60

    Mistral AI 发布生产级 AI 平台 Mistral AI Studio

    Mistral AI 发布企业级生产 AI 平台 Mistral AI Studio,整合 Observability、Agent Runtime 和 AI Registry。Agent Runtime 基于 Temporal,支持混合、专用和自托管部署,平台还提供评测、版本追踪、反馈数据集、审计与访问控制。AI Studio 现开放 private beta 注册。

    推荐理由:Mistral AI 将自身大规模系统的可观测性、Agent Runtime 与治理能力产品化,帮助企业把提示词、评测和部署纳入持续反馈闭环。

7月30日周三
7月17日周四
  1. Mistral AI77

    Mistral AI 为 Le Chat 发布 Deep Research、语音模式等多项功能

    Mistral AI 为 Le Chat 发布 Deep Research(Preview)、语音模式、Projects、多语言推理和高级图像编辑等功能。Deep Research agent 可规划问题、搜索资料并生成带引用的结构化报告,语音模式由 Voxtral 驱动,Think mode 由 Magistral 驱动。

    推荐理由:Le Chat此次更新覆盖研究、语音、项目管理和图像编辑,展示了多种交互能力如何集中到同一助手中。

7月11日周五
5月27日周二
  1. Mistral AI80

    使用 Mistral Agents API 构建 AI 智能体

    Mistral AI 发布 Agents API,为 AI 智能体提供代码执行、web search、图像生成、Document Library、MCP 工具、持久记忆和多智能体编排能力。启用 web search 后,Mistral Large 和 Mistral Medium 在 SimpleQA 上分别达到 75% 和 82.32%,未启用时为 23% 和 22.08%。

    推荐理由:原文同时展示了内置连接器、持久记忆与多智能体交接机制,并用 SimpleQA 对比了启用 web search 前后的结果。

5月21日周三