invideo 如何借助 GPT-6 Astra 将调色提升 3 倍
invideo 使用 GPT-6 Astra 更精准地规划编辑,将色彩校正与调色提升 3 倍,并在一天内生成 50 种定制效果。
invideo 使用 GPT-6 Astra 更精准地规划编辑,将色彩校正与调色提升 3 倍,并在一天内生成 50 种定制效果。
ChatGPT Ads 正在拓展至东南亚和台湾,为符合条件的企业提供新的广告触达方式。相关企业可借此触达覆盖60多个国家的用户。
Simon Willison 发布了标题为 llm-anthropic 0.29 的 Monthly briefing,其中列出 llm 635 和 anthropic 343。读者每月支付 $10,可获得精选的当月重要 LLM 动态邮件摘要。
Simon Willison 发布 llm-typesafe 0.1a0,为 LLM 增加对 TypeSafe AI Jev 模型的支持。该插件可通过命令行提出 yes/no、choice 和 score 类型问题,并返回结构化结果。
NVIDIA 发布 Isaac ROS 5.0,为基于 ROS 的机器人开发引入智能体工作流和平台支持。
推荐理由:文章将 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持与 Jetson 部署路径串联起来,呈现其从开发到机器人落地的变化。
Hugging Face 为 Transformers 增加 GGUF 模型支持,用户可通过 from_pretrained 在 Apple Silicon Mac 上使用熟悉的 Transformers API 运行量化模型。
推荐理由:文章说明了 GGUF 接入 Transformers 的加载方式、Apple Silicon 性能路径与适用边界,便于开发者评估本地推理工作流。
NVIDIA 推出 DSX Ready 资格认证计划,用于评估符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品和解决方案。
Higgsfield AI 借助 GPT-6 Astra,在一天内推出新视频功能,简化小企业的视频广告制作。GPT-6 Astra 还帮助 Higgsfield AI 更快将新的创意工具推向市场。
OpenAI Academy 扩展面向员工、开发者、领导者、教育工作者和学生的新学习路径,帮助不同群体建立并展示实用的 AI 技能。
V7 使用 GPT-5.6 Luna 将分散的公司文件转化为上下文,供 AI 智能体完成复杂、带来源链接的工作,同时降低 78% 成本并提升准确率。
Hugging Face 发布 tokenizers v1 release candidate,官方基准显示其在 Apple M4 Max 单线程下的编码速度达到 v0.23 的 3 到 30 倍。
推荐理由:文章用统一的 tokbench 基准比较 v1 与 v0.23 的编码表现,并解释缓存、SIMD 分词和无分配合并循环分别带来的加速来源。
Simon Willison 发布 llm-keys-ui 0.1 插件,可让 Codex Remote 通过包含本地网络或 Tailscale 设备 IP 的 URL 保存 API key,而不必将密钥直接粘贴到 ChatGPT app。之后,智能体可在 shell 命令中使用 `llm keys get anthropic` 读取对应密钥。
Pawprint Studio 的免费开放世界生物捕捉 RPG《Aniimo》于本周登陆 GeForce NOW,支持 Steam Deck、Firefox 等设备串流,无需等待 45GB 下载。
Cooley 借助 ChatGPT Work 构建 GO Public,将智能能力引入 IPO 流程,帮助律师更早发现问题,并将判断集中在更关键的环节。
OpenAI 推出面向法律领域的 Astra。OpenAI for Law 提供前沿智能、定制化律所工作流、互联法律数据源,以及用于保密客户工作的法律级控制。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中首次提交预览结果,在 Qwen3-VL 上的吞吐量最高达到 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上最高达到 2.5x。
推荐理由:文章将 Vera Rubin NVL72 的模型吞吐、GB300 NVL72 的跨机架扩展效率与软件优化增益放在同一组 MLPerf 结果中,便于比较推理基础设施的长期经济性。
OpenAI 展示了由 AI 驱动的新型广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。
Mistral 宣布与 Mozilla 合作,为 Firefox Smart Window 提供模型支持,帮助用户处理复杂搜索、找回浏览内容并根据浏览器标签整理信息。该功能目前面向法国和北美用户,英国和德国预计 later this year 推出;对话默认不保存在 Mozilla 服务器,Mistral 同意 zero data retention。
推荐理由:文章交代了 Firefox Smart Window 的模型来源、覆盖地区与隐私安排,也呈现了浏览器 AI 在开放分发和用户控制上的合作思路。
Hex 使用 GPT-6 Astra,让其数据智能体将分析答案转化为员工愿意分享的交互式可视化内容。GPT-6 Astra 帮助 Hex 将复杂分析呈现为可视化报告。
ChatGPT Work 和 Codex analytics 帮助团队了解 AI 的使用情况与支出,并将 AI 采用情况与业务成果建立联系。相关分析还能识别团队的培训需求。
NVIDIA介绍 DSX AI 工厂平台,通过动态功耗分配、工作负载调度和电网响应,在固定电力预算下提高 token 吞吐。Lambda 在 HGX B200 五机架、19 节点集群上实现了 24% 的集群 token 吞吐提升和 23% 的每瓦性能提升。
推荐理由:文章将 DSX 的功耗调度、需求响应和 800V DC 架构放在同一套 AI 工厂框架中,并给出 Lambda 的吞吐与性能功耗数据。
ALTK-Evolve 新增 Consistency Analyzer 和 consistency guidelines,用于诊断并降低 ReAct agent 重复执行同一任务时的 consistency gap。
推荐理由:文章把平均成功率与重复运行可靠性拆开衡量,并给出无需端到端重放任务的诊断与修复流程,便于评估生产智能体的稳定性。
Fyxer 使用 OpenAI 模型、微调、记忆和真实用户反馈,打造用户信赖的 AI 执行助理。该产品可整理收件箱,并以每位用户的口吻起草邮件。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可运行的能力,旨在帮助工程师减少代码审查、交付更多软件。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可连接公司数据、发现洞察,并通过自然语言构建交互式仪表盘。
推荐理由:这项更新把企业数据连接、洞察发现和交互式仪表盘构建整合到自然语言操作中,呈现了数据智能体的主要使用场景。
OpenAI推出面向金融服务的ChatGPT,集成金融数据和GPT-6 Astra,用于研究、建模及制作面向客户的材料。
OpenAI 推出 Agents API,支持构建和部署由 Codex harness 驱动的云端智能体。该托管服务提供编排、长时会话和工具调用能力。
推荐理由:原文概述了 Agents API 的托管形态及核心能力,涵盖编排、长时会话和工具调用,便于理解其服务边界。
Hugging Face 构建了 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能。该工作流包含 73 个节点和 11 条媒体处理管线,覆盖文生图、图生图、检测、放大、背景移除和图生视频等任务。画布输出可自动成为 REST endpoint 和 MCP 工具,用户还能复制 Space 后替换模型、删除节点或重新连接流程。
推荐理由:文章通过一个可复制和改造的案例,展示 Gradio Workflow 如何把多模型、多模态流程连接为可在浏览器和 MCP 中调用的工作流。
MIT 研究者借助 GPT-5.6 Sol 与 Codex,自主运行量子计算实验、分析实验结果并校准 qubits。该应用将模型能力用于量子计算实验流程。
Google DeepMind 推出 AlphaGenome Atlas,预计算人类基因组约 9 billion 个单核苷酸变异的分子影响预测。平台提供由 AlphaGenome 和 AlphaMissense 预测整合而成的 AVI score,并通过网站、AlphaGenome API 和 Google Antigravity 中的 skill 提供访问。
推荐理由:文章把 AlphaGenome Atlas 的数据、AVI 评分和真实研究案例串联起来,呈现其如何帮助研究者筛选非编码变异并追踪分子影响。
GitHub Copilot 推出 Project HydraFusion 研究预览,可在运行时从多个提供商的模型中选择并编排执行流程。HydraFusion目前支持 Single、Cascade 和 Critique 三种模式,并通过 Copilot CLI 的 /experimental 向所有 GitHub Copilot 计划用户开放。
推荐理由:GitHub Copilot 将多模型选择、评审与升级纳入运行时流程,并用三项 agentic coding 基准展示质量与成本之间的具体权衡。
Hugging Face 推出开源工具 funes,将 Claude Code、Codex、pi 和 Hermes 的会话在本地建立索引,让智能体能够检索过去的决策、原因和发现。
推荐理由:funes把编码智能体的历史会话转为可检索记忆,并支持跨智能体与设备共享,原文还展示了其成本对比和证据追溯方式。
Google推出 Fairwind Program,向政府、Google Cloud 客户和可信网络安全伙伴限量开放网络防御能力。该计划将 Gemini 3.8 Flash Cyber 与 CodeMender 结合,用于自主发现、验证和修复漏洞,并在安全云环境中生成可部署补丁。计划已有超过 650 家合作伙伴参与,接入组织须限制使用人员并部署多因素认证等保护措施。
推荐理由:原文说明了 Fairwind Program 的服务对象、核心工具与接入限制,便于理解其面向政府和企业的部署方式。
Google DeepMind 发布 agentic video understanding,面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,用于视频分析。
推荐理由:文章给出 agentic video understanding 的工作机制、基准变化与接入方式,便于评估长视频分析的成本和开发门槛。
Hugging Face 发布 JavaScript 库 @huggingface/kernels 和浏览器 GPU 基准测试套件 Fleet,并在 Hugging Face Hub 提供首批 207 个 WebGPU kernels。
推荐理由:文章同时给出 207 个 kernel 的版本化组织方式、Fleet 众测机制和 ORT WebGPU 对比数据,便于理解浏览器推理性能优化的落地路径。
Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。
推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。
Gradio 的 gr.Workflow 将 AI 流程表示为带类型节点的图,提供可拖放画布,让每个节点都能运行并查看中间结果。同一张工作流图还可作为 REST API,并通过一条命令部署到 Hugging Face Spaces。
推荐理由:文章通过图像编辑、媒体工作室、数据集分析和 ZeroGPU 动画示例,展示 gr.Workflow 如何把可视化调试、API 调用与部署整合到同一张工作流图中。
Mistral AI 发布 Agentic Search,通过多步检索循环让 AI 系统搜索、打开、导航、读取并验证复杂文档中的信息。FinanceBench 上准确率从 26.7% 提升至 86%,OfficeQA Pro 上从 6.3% 提升至 51.9%,p90 延迟最高降低 39.6%,token 消耗最高减少三分之一。
推荐理由:文章通过 FinanceBench 与 OfficeQA Pro 的对比,具体展示 Agentic Search 如何在复杂文档检索中兼顾准确率、延迟与 token 消耗。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,支持 ColBERT 风格的 late interaction 检索。
推荐理由:文章将 MultiVectorEncoder 的 late interaction 原理、索引开销与接入方式放在一起,并覆盖文本和视觉文档检索等实际场景。
OlmoEarth Studio 现支持基于开源 OlmoEarth 基础模型计算并导出地球观测嵌入向量,结果以 Cloud-Optimized GeoTIFF(COG)提供。
推荐理由:OlmoEarth Studio 将地球观测数据嵌入向量导出为可共享的 COG,并展示了从相似性搜索到变化检测的具体用法。