跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–20 条 · 共 69 条
今天10月1日周四
  1. AWS Machine Learning Blog71

    Claude Sonnet 5.5 登陆 Amazon Bedrock 和 AWS 上的 Claude Platform

    AWS宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 AWS 上的 Claude Platform 提供,面向聚焦型编码与知识工作,速度更快且大多数任务的单任务成本更低。

    推荐理由:文章同时给出 Sonnet 5.5 与 Opus 5.5 的任务分工,以及在 Amazon Bedrock 上的调用路径,便于评估模型选型与落地方式。

  2. AWS Machine Learning Blog71

    Amazon Bedrock Knowledge Bases 如何用自然语言查询理赔记录

    AWS 介绍如何用 Amazon Bedrock Knowledge Bases 和 Amazon S3 构建带引用的理赔问答助手,通过 AgenticRetrieveStream 处理多轮问题、多条件检索和流式回答。教程还演示了基于元数据的筛选、Amazon Bedrock Guardrails 的上下文接地检查,以及对合成数据集的检索和引用评估。

    推荐理由:文章以合成理赔数据演示从文档摄取、自然语言检索到引用和权限控制的完整实现路径,适合迁移到文档问答场景。

9月30日周三
  1. NVIDIA Blog74

    CoreWeave 提供 NVIDIA Vera Rubin NVL72 并发布 CoreWeave Forge

    CoreWeave宣布在CoreWeave Cloud提供NVIDIA Vera Rubin NVL72,并发布用于训练、评估和改进模型与智能体的CoreWeave Forge。Cognition测试显示,Vera Rubin NVL72在SWE-2推理工作负载上的总token吞吐量最高达到GB200 NVL72的4.8x;NVIDIA Vera CPU的智能体沙盒启动速度超过3x。

    推荐理由:文章串联了 Vera Rubin、Vera CPU 与 Forge 的产品进展,并给出 Cognition 和 CoreWeave 的实测数据,便于理解智能体从训练到生产的基础设施路径。

  2. AWS Machine Learning Blog61

    Amazon Bedrock 在 Seoul 支持 Claude Opus 5 与 Claude Sonnet 5、在 Singapore 支持 Claude Sonnet 5 区域内推理

    Amazon Bedrock 现已在 Seoul 为 Claude Opus 5 和 Claude Sonnet 5、在 Singapore 为 Claude Sonnet 5 提供区域内推理。

    推荐理由:文章说明了 Claude 模型在 Seoul 与 Singapore 的单区域推理范围,并提供控制台、SDK 和 API 调用示例,适合评估数据驻留场景的接入方式。

  3. AWS Machine Learning Blog74

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 上正式可用,面向编码、计算机使用和专业工作负载提供更强推理。OpenAI 称其在 DeepSWE v1.1 上达到 GPT-6 Astra 的表现,单任务成本约为其五分之一,并以低于 GPT-6 Sol 相关结果的 reasoning effort 超出后者最高分 6.4 个百分点。

    推荐理由:原文以 DeepSWE v1.1 的成本与性能对比,说明 GPT-6.1 Sol 如何服务编码和多步骤智能体工作流。

  4. AWS Machine Learning Blog66

    用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 合同智能平台

    AWS 展示了一套基于 Amazon Quick 和 Amazon Bedrock AgentCore 的合同智能平台,将合同 PDF 转换为可查询的结构化数据,并支持组合分析与单份合同问答。

    推荐理由:文章展示了面向多文档聚合的可迁移架构,将结构化提取、独立模型校验与数据库分析结合,弥补单纯 RAG 的局限。

9月29日周二
  1. AWS Machine Learning Blog64

    AWS 在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用 第 1 部分

    AWS 介绍如何在 SageMaker AI 上使用 AWS vLLM-Omni DLC 部署 Qwen3-TTS,让文本输入和音频输出通过同一条持久双向连接流式传输。教程提供 GitHub 示例、部署脚本和 Gradio 应用,音频以 24 kHz PCM 分块返回。示例使用 vLLM-Omni v1.5 DLC 与 SageMaker 实例池,并说明了部署、调用和清理端点的步骤。

    推荐理由:文章以 Qwen3-TTS 为例展示从模型部署、双向流式传输到 Gradio 调用的完整路径,便于复用这一多模态推理方案。

  2. AWS Machine Learning Blog62

    教程:AWS 在 SageMaker AI 上用 vLLM-Omni 生成图像并将其动画化为视频

    AWS 介绍如何在 Amazon SageMaker AI 上部署两个 vLLM-Omni 端点,将 FLUX.2-klein-4B 生成的图像传给 Wan2.1-VACE-1.3B,生成短视频。图像端点采用实时推理,视频端点采用异步推理,并通过 Amazon S3 传递 multipart 请求和获取 MP4 结果。文章还提供命令行与 Streamlit 示例、部署命令及清理脚本。

    推荐理由:文章把图像实时推理与视频异步推理串成可复用流程,并给出部署脚本、请求格式和清理步骤,便于理解两种响应模式的取舍。

9月28日周一
  1. AWS Machine Learning Blog62

    Amazon Textract 适配器跨账户生命周期管理实践

    AWS 介绍如何将 Amazon Textract Custom Queries 适配器纳入跨账户生产生命周期管理,覆盖创建、推广、路由与安全配置。文章比较跨账户复制和集中式 Hub 账户两种推广方案,并说明适配器复制只会转移训练模型权重,查询定义与训练数据需要单独维护。

    推荐理由:文章把跨账户推广、文档路由和生产安全拆成可实施的架构,并提供 CloudFormation、Terraform 与 CLI 示例,适合评估落地路径。

9月26日周六
  1. AWS Machine Learning Blog67

    NarrateAI:在 Amazon Bedrock 上构建生产级 LLM 质量保障

    AWS 介绍了运行在 Amazon Bedrock 上的 NarrateAI 质量保障架构,通过自适应流水线编排、跨账户多模型故障切换、实时流式评估、组合式评估和数据准确性核验,支持实时生成经过验证的回答。该系统在覆盖 4,000 多名用户的六个月部署中,响应约 13 秒开始流式输出,数值准确率达到 99.3%。

    推荐理由:文章把查询路由、跨账户多模型故障切换、流式评估与数值核验串成一条工程链,适合参考生产级 LLM 应用如何兼顾准确性、延迟和吞吐。

  2. AWS Machine Learning Blog66

    AWS 教程:在 Amazon SageMaker AI 上部署 Qwen3-TTS 实时声音克隆

    AWS 介绍了如何通过 Amazon SageMaker JumpStart,将公开可用的 Qwen3-TTS-12Hz-1.7B-Base 部署到 Amazon SageMaker AI 实时推理端点,实现基于短音频和文本转录的声音克隆。教程涵盖 24 GB NVIDIA L4 GPU 配置、跨语言声音克隆、请求调用以及 Amazon CloudWatch 监控。

    推荐理由:文章给出从 JumpStart 部署 Qwen3-TTS 并调用实时端点完成声音克隆的完整步骤,涵盖 GPU 内存配置和 CloudWatch 监控。

9月24日周四
  1. Microsoft Research72

    Microsoft Research:物理 AI 机器人推理卸载可提升性能与续航

    Microsoft Research 的研究显示,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可提升移动操作任务的成功率、模型运行能力和电池续航。

    推荐理由:文章以移动操作机器人工作负载为对象,比较板载、边缘与云端 GPU,呈现推理基础设施对任务成功率、续航和模型部署的具体影响。

9月22日周二
  1. NVIDIA Blog63

    NVIDIA为何强调物理 AI 规模化部署需要全层级安全

    NVIDIA指出,物理 AI 从研究走向大规模部署后,自动驾驶汽车和机器人需要在硬件、软件、AI 行为、运行环境及整个部署生命周期中持续满足安全要求。NVIDIA介绍了覆盖 AV 与机器人的 NVIDIA Halos 全栈安全系统,以及仿真、合成数据、运行时监控和第三方评估等安全基础设施。

    推荐理由:文章把物理 AI 的安全拆解到硬件、软件、AI 行为、运行环境和部署生命周期,并以 NVIDIA Halos 展示 AV 与机器人场景的工程化路径。

9月21日周一