跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 41–60 条 · 共 71 条
7月23日周四
7月16日周四
  1. Hugging Face Blog63

    Agent 中的模型路由看似简单,直到它变得复杂

    作者将 Agent 中的模型路由从分类问题转为同时优化成本、质量和延迟的系统优化问题。在 AppWorld Test Challenge 的 417 个任务中,使用同一 CodeAct agent 时,Claude Sonnet 4.6 总成本为 $79,而 GPT-4.1 为 $155,缓存读取价格差异是重要原因之一。

    推荐理由:文章用实测数据说明模型路由的真实成本受缓存、基础设施和治理约束共同影响,适合用于理解智能体路由的系统优化视角。

7月10日周五
  1. Hugging Face Blog73

    PyTorch 性能分析(第 3 部分):用 profiler 分析 Attention

    Hugging Face Blog 通过 profiler 分析 PyTorch 中的朴素 Attention、原地掩码操作和 SDPA 各后端,展示不同实现的 kernel 与 CPU、GPU 开销。

    推荐理由:文章通过逐层对比 profiler trace,解释 Attention 的 kernel、显存流量与 CPU 开销如何变化,为定位 GPU 性能瓶颈提供可复用的阅读方法。

7月8日周三
  1. Hugging Face Blog79

    Hugging Face transformers 建模后端实现 vLLM 原生推理速度

    Hugging Face 宣布 transformers 建模后端在 vLLM 中已能为多种 LLM 架构达到或超过自定义 vLLM 实现的吞吐速度。该后端在 Qwen3-4B、Qwen3-32B 和 Qwen3-235B-A22B-FP8 三种部署配置中均达到或超过原生实现速度,并可通过 `--model-impl transformers` 启用。

    推荐理由:文章通过 Qwen3 的 4B、32B 和 235B FP8 MoE 对比,说明该后端如何减少模型接入 vLLM 时的重复优化工作。

7月7日周二
  1. Hugging Face Blog80

    Hugging Face 发布 LeRobot v0.6.0,完善机器人学习闭环

    Hugging Face 发布 LeRobot v0.6.0,新增世界模型策略、奖励模型、六个仿真基准和 lerobot-rollout 部署 CLI。数据集支持深度、VLM 自动语言标注和自定义视频编码,数据加载最高提速约 2x;训练新增 FSDP 与 HF Jobs 云训练。

    推荐理由:LeRobot v0.6.0 将世界模型策略、奖励模型、统一评测和部署采集串成闭环,并补充数据处理与云训练能力,便于理解机器人学习工作流的变化。

7月6日周一
  1. Hugging Face Blog71

    Hugging Face Kernels 项目迎来重大更新

    Hugging Face 对 Kernels 项目进行了大幅重构,新增 Hub 的 kernel 仓库类型,并默认限制为可信发布者加载 kernel。项目加入代码签名支持,重构 kernels 与 kernel-builder CLI,还扩展了 Torch Stable ABI 和 Apache TVM FFI 支持。

    推荐理由:文章集中说明 Kernels 在安全机制、框架兼容和智能体开发流程上的改动,便于开发者判断其对自定义 kernel 构建与分发的实际帮助。

7月1日周三
  1. Hugging Face Blog70

    ScarfBench:面向企业 Java 框架迁移的 AI 智能体基准

    ScarfBench 是一个用于评估 AI 智能体执行企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus。基准包含 34 个应用、204 个迁移任务和约 151K 行代码,要求应用完成构建、部署并通过行为验证;当前最强智能体的行为成功率仍低于 10%。

    推荐理由:ScarfBench把企业 Java 框架迁移拆成构建、部署和行为验证,揭示编码智能体在可编译代码之外仍受配置与运行环境依赖影响。

6月24日周三
  1. Mistral AI76

    Mistral AI 为 Connectors 带来更多连接器控制能力

    Mistral AI 为 Connectors 新增工作区与组织级管理、带权限范围的 API keys、多账户连接器和 Connectors Debugger。Connectors in Vibe Code 已 GA,Connectors in Workflows 处于 Public Preview;目录现有超过 60 个集成,并支持自定义 MCP 连接器。

    推荐理由:这次更新集中说明了企业智能体接入外部系统所需的授权边界、自动化身份和故障定位能力,并列出各项功能的可用状态。

6月23日周二
  1. Mistral AI71

    Mistral AI 发布 Mistral OCR 4 文档解析模型

    Mistral AI 发布 Mistral OCR 4,支持 170 languages,并可返回 bounding boxes、区块类型和逐词 confidence scores。

    推荐理由:文章同时呈现了 Mistral OCR 4 的结构化解析能力、部署方式与成本,便于比较其在企业文档流程中的适用场景。

5月28日周四
  1. Mistral AI70

    Mistral AI 发布开源 Search Toolkit 公测版

    Mistral AI 发布 Search Toolkit public preview,这是一个用于构建 AI 应用生产级搜索流水线的开源框架,统一了数据摄取、检索和评估接口。它支持 BM25、基于嵌入向量的密集检索与混合检索,并提供 recall、precision、MRR 和 NDCG 等评估指标,可部署在云端、本地或边缘基础设施上。

    推荐理由:Search Toolkit 将数据摄取、检索与评估置于统一接口下,并提供 BM25、向量和混合检索,便于团队在自有数据上比较检索质量。

  2. Google Research63

    Google Research 推出基于零信任聚合的私有分析方案

    Google Research 推出一种基于零信任原则的私有分析方案,将单消息加密聚合与 TEE 结合,以减少对单一实体的信任依赖。该方案采用基于格的协议,确保服务器只能获得匿名聚合结果,原始数据不会在服务器内存中暴露或重建。Android SafetyCore 将使用这套方案评估安全工具效果,同时让用户内容留在设备端。

    推荐理由:文章解释了单消息加密聚合如何与 TEE 形成多层防护,并以 Android SafetyCore 说明其在端侧模型分析中的应用。

5月23日周六
  1. Mistral AI66

    Mistral AI 达成收购 Physics AI 公司 Emmi AI 的协议

    Mistral AI 已达成收购 Emmi AI 的协议,以增强模型理解和建模物理的能力,并让 AI 智能体使用现有工程工具。Emmi AI 的联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队,双方将推进实时仿真、数字孪生及面向工程师的智能体。

    推荐理由:这项收购串联了 Physics AI、工程工具与智能体能力,呈现 Mistral AI 面向工业研发和制造扩展产品布局的具体路径。

5月6日周三
  1. Google DeepMind68

    Google DeepMind 展示 AlphaEvolve 在多领域扩展应用

    Google DeepMind 发布报告称,Gemini 驱动的编码智能体 AlphaEvolve 已从试点工具扩展为 Google 基础设施的核心组件,并用于商业场景。

    推荐理由:文章集中展示 AlphaEvolve 在科研、基础设施和商业场景中的应用,用具体指标说明算法优化能力如何迁移到不同领域。

4月27日周一
  1. Mistral AI75

    Mistral AI 发布 Workflows 公测版,支持企业 AI 流程编排

    Mistral AI 发布 Workflows 公测版,将企业 AI 流程的持久执行、可观测性和容错能力整合到 Studio 中。开发者可用 Python 编写工作流,业务团队从 Le Chat 触发;v3.0 Python SDK 已公开,可通过 `uv add mistralai-workflows` 安装。

    推荐理由:原文展示了 Workflows 如何把持久执行、可观测性和人工审批整合进企业 AI 流程,并给出 Python SDK 的接入方式。

4月22日周三
3月31日周二
  1. Mistral AI73

    Mistral AI 介绍面向人类与智能体的 Spaces CLI

    Mistral AI 介绍 Spaces CLI,它可通过 `spaces init`、`spaces dev` 等命令搭建多服务项目,并生成配置文件与 Dockerfiles。为支持编码智能体,Spaces 为交互输入提供 flag 等价方式,使用插件注册表返回结构化数据,并在项目初始化时生成 context.json 和 AGENTS.md;文中示例从提示到部署耗时不到 10 分钟。

    推荐理由:文章将交互输入、显式状态和结构化上下文落到 CLI 设计中,给面向智能体的开发工具提供了可复用的实现思路。

3月11日周三
  1. Mistral AI61

    Mistral AI 如何构建自动生成 Rails 测试的智能体

    Mistral AI 基于开源编码助手 Vibe 构建了一个自动生成和改进 Rails RSpec 测试的智能体,可读取源文件、执行测试并通过 RuboCop 和 SimpleCov 自我校正。该智能体处理了 275 个源文件,测试通过率和平均代码覆盖率均为 100%,RuboCop 违规数为 0,LLM-as-a-judge 得分为 0.74。

    推荐理由:文章拆解了用 AGENTS.md、分类技能和自定义工具约束智能体生成测试的做法,并给出真实代码库中的量化结果。

1月28日周三
  1. Mistral AI79

    Mistral AI 发布终端编码智能体 Mistral Vibe 2.0

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。Mistral Vibe 2.0 面向 Le Chat Pro 和 Team 计划开放,支持按量付费或 BYOK;Devstral 2 转为付费 API 访问,输入价格为 $0.40/M tokens,输出价格为 $2.00/M tokens。

    推荐理由:Mistral Vibe 2.0 将子智能体、澄清选项和斜杠命令技能纳入终端编码工作流,适合了解智能体可配置性的开发者参考。