Grok 4.7 登陆 Amazon Bedrock,支持长上下文与可配置推理
xAI 的 Grok 4.7 已上线 Amazon Bedrock,面向编码、长时运行的智能体和知识工作,提供 500K token 上下文窗口及 low、medium、high、xhigh 四档推理强度。
推荐理由:文章将 Grok 4.7 的长上下文与推理档位和 Bedrock 的接入、路由及认证方式对应起来,便于评估部署成本与使用路径。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
xAI 的 Grok 4.7 已上线 Amazon Bedrock,面向编码、长时运行的智能体和知识工作,提供 500K token 上下文窗口及 low、medium、high、xhigh 四档推理强度。
推荐理由:文章将 Grok 4.7 的长上下文与推理档位和 Bedrock 的接入、路由及认证方式对应起来,便于评估部署成本与使用路径。
AWS 介绍了如何结合 Amazon Nova Act 与 Amazon Bedrock AgentCore,构建用于验证登录、搜索、购物车和结账流程的智能体驱动合成监控。
推荐理由:文章给出从旅程定义、Agent 部署到定时告警的完整实现路径,并用示例仓库展示如何减少基于 DOM 选择器的维护工作。
Holo4 发布通用智能体模型系列,提供 27B dense 和 35B-A3B Mixture of Experts 两种规格,可通过 GUI、代码、MCP 和 API 与软件交互。
推荐理由:文章同时给出 OSWorld 2.0 成绩、成本口径与可复现轨迹,便于比较 Holo4 在多界面工作流中的实际取舍。
OpenRouter 联合创始人 Alex Atallah 与 AMP 的 Anjney Midha 讨论了 OpenRouter 如何从多模型路由服务发展为 AI 模型的中立分发层,并加入 Stripe。
推荐理由:访谈梳理了 OpenRouter 从模型路由到分发基础设施的演进,也解释了多模型生态与智能体流量带来的新安全问题。
GitHub Copilot app 的 canvases 可根据自然语言描述生成自定义界面,让用户与 Agent 共同操作看板、清单、表单或其他工作流。用户可在 Agent 会话中运行 `/create-canvas`,描述工作流、界面操作和 Agent 能力,系统会生成并打开对应界面。创建后的 canvas 可保存为扩展,供团队共享或个人重复使用。
推荐理由:文章通过 /create-canvas 的具体流程,说明如何让用户与 Agent 共同维护可交互界面,并将其保存为团队或个人扩展。
AWS 介绍了运行在 Amazon Bedrock 上的 NarrateAI 质量保障架构,通过自适应流水线编排、跨账户多模型故障切换、实时流式评估、组合式评估和数据准确性核验,支持实时生成经过验证的回答。该系统在覆盖 4,000 多名用户的六个月部署中,响应约 13 秒开始流式输出,数值准确率达到 99.3%。
推荐理由:文章把查询路由、跨账户多模型故障切换、流式评估与数值核验串成一条工程链,适合参考生产级 LLM 应用如何兼顾准确性、延迟和吞吐。
Runway 在 GWM Worlds 2 研究预览中推出 WorldPrompt,可固定模拟环境的部分要素并创建带时间戳的事件,也支持实时提示动作。GWM Worlds 2 能以 720p、24 fps 视频和 48,000 Hz 音频生成交互世界,其实时化依赖自回归生成与蒸馏。文章还讨论了误差累积、长时记忆、因果性和无结构状态等限制,以及世界模型在游戏、机器人和智能体测试中的用途。
推荐理由:文章结合 WorldPrompt 的控制方式与实时生成的工程难题,梳理世界模型在游戏、机器人和智能体测试中的应用路径。
GitHub Copilot 应用中的 canvas 是运行在应用内、无浏览器界面的 full-stack app,可与 Agent 双向通信,让用户为具体任务生成定制界面。文章以 Connect 4、Winget、SQLite 和开发工作流为例,展示 canvas 如何支持游戏交互、本地包管理、数据库操作和流程自动化。
推荐理由:文章通过 Connect 4、Winget、SQLite 和开发流程案例,说明 GitHub Copilot canvas 如何把智能体交互转成可操作的任务界面。
Google Research 提出面向连贯长视频生成的 AI 视频协作导演体系,由 Co-Director、CANVAS、A²RD 和 VQQA 四个框架组成。
推荐理由:这项研究把长视频生成拆解为故事规划、视觉记忆、时序扩展和提示词闭环修正四个环节,并给出对应框架与基准结果。
基于 GitHub Security Lab Taskflow Agent 构建的 Fuzzing Taskflow,可为 C/C++ 项目自动完成入口识别、构建分析、harness 编写、AFL++ 运行、覆盖率改进、崩溃分诊和漏洞报告生成。
推荐理由:文章具体拆解了 Fuzzing Taskflow 如何把 C/C++ 模糊测试中的 harness 编写、覆盖率反馈和崩溃分诊交给 LLM agent,并说明运行时的安全边界。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为企业对话式 AI 加入近实时视频生成、语音和动态视觉形象。
推荐理由:文章集中说明 Live Avatar 的多模态交互、异步工具调用和 97 种语言支持,并交代 Gemini Enterprise 的使用入口与定制头像限制。
Anthropic 发布 Claude Opus 5.5,作为 Claude 5.5 family 首个模型并成为 Claude Code 与 Claude app 的默认模型。
推荐理由:文章把 Claude Opus 5.5 的基准表现、默认设置与 token 成本放在一起,并与 GPT-6 Sol、Luna 对照,便于理解降价和用量变化的关系。
Anthropic 发布 Claude Opus 5.5,OpenAI 随后发布 GPT-6 Sol 与 GPT-6 Luna,作者分享了初步体验。GPT-6 Luna 的输入和输出价格为 $0.10/M 与 $0.50/M,GPT-6 Sol 也较 GPT-5.6 Sol 降价一半。
推荐理由:文章将多款新模型的定价变化与 SVG 和编码场景下的初步体验放在一起,便于比较成本与推理表现。
NVIDIA 发布 Isaac ROS 5.0,为基于 ROS 的机器人开发引入智能体工作流和平台支持。
推荐理由:文章将 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持与 Jetson 部署路径串联起来,呈现其从开发到机器人落地的变化。
Xiaomi 发布 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两个开放权重的原生全模态模型,并公布技术报告、RL 环境和训练代码。
推荐理由:文章不仅介绍 MiMo-V2.6 的模型规模与价格,还梳理其 RL 训练环境和代码开放计划,便于理解其训练路线与开源范围。
Latent Space采访TypeSafe AI CEO Diogo Almeida,介绍Jev作为面向软件的可编程System One模型,目标是提升每美元的智能表现。Almeida解释了RLCD与RLHF、RLVR在训练目标上的差异,强调校准、可靠性和可组合性,并说明TypeSafe更重视任务与数据而非公开基准。
推荐理由:这场访谈从模型训练目标、校准可靠性和软件集成三个层面,解释了 Jev 与聊天型模型的设计差异。
Google Research 分享一项研究实验,利用为教育优化的生成式 UI,让教师按课程目标动态创建定制的互动学习模拟。研究团队同时发布了30多个英文 STEM 学习互动内容,覆盖物理、化学、生物和数学,并由教师审核。对12名美国教师的初步研究中,互动内容质量平均评分为8分(满分10分),Google 还将通过试点项目继续收集学校反馈。
推荐理由:文章将生成式 UI、分级挑战和分层指导纳入教师主导的流程,并结合教师审核与试点数据,呈现定制化 STEM 练习的实现路径。
GitHub Copilot 团队使用 GitHub Copilot app 和 Copilot CLI,将 Copilot agent runtime 从 TypeScript 重写为超过 800,000 行生产 Rust,主要代码由 AI agents 编写,历经 128 个 pull requests,并在数月内由一名开发者主导完成。
推荐理由:文章以 GitHub Copilot runtime 的 Rust 重写为案例,梳理渐进式迁移、跨语言互操作和人机协作中的具体做法。
Salesforce 发布首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super,并使用近三十年企业 CRM 部署生成的专有合成数据进行后训练。
推荐理由:文章梳理了 Koa 的训练来源、数据隔离和 CRM Bench 表现,并交代了客户试点与正式可用时间。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本对话和高复杂度任务。
推荐理由:文章同时给出两款模型的定位、语音智能体基准表现与开发者入口,便于比较能力重点和落地路径。