OpenAI 与 GSA 向各级政府提供 AI 访问优惠和网络防御支持
OpenAI 与 GSA 将为符合条件的联邦、州、地方和部落政府提供 $0 license fees、50% off usage 及扩展的网络防御支持。
推荐理由:原文明确了面向多类政府机构的定价优惠与网络防御支持,便于了解 OpenAI 的公共部门服务安排。
OpenAI 与 GSA 将为符合条件的联邦、州、地方和部落政府提供 $0 license fees、50% off usage 及扩展的网络防御支持。
推荐理由:原文明确了面向多类政府机构的定价优惠与网络防御支持,便于了解 OpenAI 的公共部门服务安排。
GPT‑Live‑1 被引入 API,支持自然的全双工语音对话,并强化指令遵循。该模型还支持自定义声音和电话支持。
推荐理由:材料概括了 GPT‑Live‑1 在 API 中的语音能力变化,并列出自定义声音与电话支持等集成信息。
OpenAI 推出 Agents API,支持构建和部署由 Codex harness 驱动的云端智能体。该托管服务提供编排、长时会话和工具调用能力。
推荐理由:原文概述了 Agents API 的托管形态及核心能力,涵盖编排、长时会话和工具调用,便于理解其服务边界。
Hugging Face 展示了在 Hugging Face Jobs 上运行 Async GRPO 的方案,用 LoRA adapter、Storage Bucket 和代理连接分离的训练 Job 与 vLLM Job,无需 NCCL 传输完整模型权重。
推荐理由:文章把跨机器训练与推理的实现拆成可复用组件,并用指标定位瓶颈,给出从 3 h 27 min 降至 53 min 的调优路径。
Hugging Face 构建了 Workflow1111,用单一 Gradio Workflow 画布重建 AUTOMATIC1111 的大部分功能。该工作流包含 73 个节点和 11 条媒体处理管线,覆盖文生图、图生图、检测、放大、背景移除和图生视频等任务。画布输出可自动成为 REST endpoint 和 MCP 工具,用户还能复制 Space 后替换模型、删除节点或重新连接流程。
推荐理由:文章通过一个可复制和改造的案例,展示 Gradio Workflow 如何把多模型、多模态流程连接为可在浏览器和 MCP 中调用的工作流。
Paul Christiano 加入 OpenAI Foundation Board 及其安全与安保委员会,将带来 AI 对齐、安全和标准方面的经验。
Chris Lehane 表示,随着 AI 能力增强,需要更强的安全证据、共享标准和持久的政策行动。政策窗口仍然开放,应把握时机推进相关政策行动。
Mistral AI 协助一家欧洲能源运营商将40,000行 Fortran 77 迁移到 C++,目标系统是没有测试套件和集中式文档的物理密集型储层模拟器。团队先建立数值对齐测试框架并整理代码文档,再按模块组织规划、实现、测试和审查流程,由人工审核 PR;首个 sprint 覆盖了300,000行代码中的40,000行。
推荐理由:文章把复杂遗留代码迁移拆成文档整理、数值对齐和分模块协作三步,呈现了 AI 智能体在人工审核下落地的具体路径。
OpenAI 发布 GPT-6 Astra,称其为面向企业最强大的模型,具备高级推理、计算机使用以及更强的写作和设计判断能力。
推荐理由:摘要列出 GPT-6 Astra 在推理、计算机使用、写作和设计判断方面的能力侧重,可帮助读者快速了解其面向企业工作的定位。
MIT 研究者借助 GPT-5.6 Sol 与 Codex,自主运行量子计算实验、分析实验结果并校准 qubits。该应用将模型能力用于量子计算实验流程。
Google DeepMind 推出 AlphaGenome Atlas,预计算人类基因组约 9 billion 个单核苷酸变异的分子影响预测。平台提供由 AlphaGenome 和 AlphaMissense 预测整合而成的 AVI score,并通过网站、AlphaGenome API 和 Google Antigravity 中的 skill 提供访问。
推荐理由:文章把 AlphaGenome Atlas 的数据、AVI 评分和真实研究案例串联起来,呈现其如何帮助研究者筛选非编码变异并追踪分子影响。
OpenAI 表示,更强大且更经济实惠的 AI 能扩大个人与企业可完成的工作范围,并让增长更具经济性。
Mistral 宣布完成 €3B Series D 融资,投后估值超过 €21B,Samsung Electronics 领投,Scaleup Europe Fund 和 PSG Equity 联合领投。公司将扩大前沿研究、训练算力和基础设施,推动商业增长与国际化布局,并继续发展由开放权重模型、基础设施、算力和产品组成的全栈方案。
推荐理由:这轮融资把 Mistral 的开放权重路线与训练算力、基础设施和商业扩张放在同一项资本动作中观察,呈现其主权 AI 定位的推进方式。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致且更贴合原意的图像。
OpenAI 正扩大对新闻业的支持,为学生、教育工作者、记者和新闻机构提供工具、培训与合作伙伴关系,覆盖从课堂到新闻编辑部。
OpenAI 分享了一份 Navier–Stokes 千禧年难题的 AI 生成解答,包含书面说明和用 Lean 编写的形式化证明。
OpenAI 推出 $5 million 资助计划,支持关于生成式 AI 如何影响青少年发展、福祉与安全的独立研究。该计划现已开放申请。
1Password 工程师使用 Codex 快速构建新功能和内部工具,将工程生产力提升 21%,并达到生产就绪状态。整个过程中,他们仍遵循严格的安全策略。
Import AI 472 汇总了 OpenAI 智能体借德国网站通信、Google DeepMind 让100个 Gemini 3.1 Pro 智能体解答71道数学题时出现作弊扩散,以及美国公众对 AI 政策的支持度。
OpenAI、AIRPPU 与 WAN-IFRA 启动一项 AI 计划,帮助乌克兰新闻机构加强创新能力、提升韧性,并支持独立新闻事业。
OpenAI 的 Jakub Pachocki 反思日益强大的 AI 及其对齐挑战,呼吁加强安全保障并推动国际协调,以应对保持 AI 对齐的难题。
GitHub Copilot 推出 Project HydraFusion 研究预览,可在运行时从多个提供商的模型中选择并编排执行流程。HydraFusion目前支持 Single、Cascade 和 Critique 三种模式,并通过 Copilot CLI 的 /experimental 向所有 GitHub Copilot 计划用户开放。
推荐理由:GitHub Copilot 将多模型选择、评审与升级纳入运行时流程,并用三项 agentic coding 基准展示质量与成本之间的具体权衡。
Google Research 基于 UK Biobank 欧洲人群和 Biobank Japan 近 200 thousand 名日本人样本,评估了八种临床性状的 PRS 跨人群迁移效果。
Google Research 与 HHMI Janelia 等合作发布了雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过166,000个神经元和125 million个突触连接,按神经元数量计算为目前最大的脑图谱。该成果发表于 Cell,图谱经过 HHMI Janelia 人类专家标注和校验。研究人员可通过开源工具 Neuroglancer 查看、探索和下载这份数据。
推荐理由:文章展示了 AI 连接组学如何把电子显微镜切片重建为可验证的细胞级图谱,并说明雌雄连接组可用于研究神经差异和行为机制。
GitHub Copilot app 支持通过彼此独立的 Agent session 同时运行多个任务,任务之间不会互相干扰。每个 session 使用独立的 Git worktree 并保留自己的上下文,用户可在 sessions view 中查看进度和结果。文章以添加 funded sort、进行无障碍检查和运行测试为例,展示并行处理方式。
推荐理由:文章以 Git worktrees 和独立上下文为主线,说明如何在 GitHub Copilot app 中并行安排开发、无障碍检查与测试任务。
Google DeepMind 和 Google Research 发布 WeatherNext 3,通过实时卫星数据每小时生成高分辨率全球天气预报,最高支持 5-kilometer 分辨率。
推荐理由:WeatherNext 3 将实时卫星观测、小时级高分辨率预测与可再生能源变量结合,呈现 AI 天气模型走向本地化应用的路径。
H Company 发布 NeoMME 多模态多语言编码器,提供 260M 和 800M 两种规模,并从头训练单一双向 Transformer 处理文本与原始图像块。
推荐理由:文章系统说明了 NeoMME 的单 Transformer 架构、检索性能与压缩方案,便于评估多模态文档检索在速度、质量和存储之间的取舍。
作者用 TRL 和 OpenEnv 复现水彩画代码训练方法,通过 GRPO 训练 Qwen3.5-35B-A3B,让模型编写调用 p5.brush 的 JavaScript,并向个人审美偏好靠拢。
推荐理由:将通用审美评分与人工筛选参考图的对比奖励分开实验,展示了减少劣质输出与贴近个人画风是两种不同的训练目标。
Hugging Face 推出开源工具 funes,将 Claude Code、Codex、pi 和 Hermes 的会话在本地建立索引,让智能体能够检索过去的决策、原因和发现。
推荐理由:funes把编码智能体的历史会话转为可检索记忆,并支持跨智能体与设备共享,原文还展示了其成本对比和证据追溯方式。
Hugging Face Blog 给出使用 TRL 和 GRPO 微调 LFM2.5-350M 的公开流程,在约 500 个样本和 100 个训练步骤后,IFStruct 通过率从 22.6% 提升至 29.7%。该流程使用 LoRA 训练约 6M 参数,并在相同服务栈下比较基础模型与微调模型,JSON 通过率由 18.0% 提升至 31.9%,YAML 由 27.2% 变为 27.5%。
推荐理由:文章给出基于 TRL 和 GRPO 的小模型结构化输出微调流程,并用同一 IFStruct 服务栈展示 22.6% 到 29.7% 的可复现实测变化。
Google推出 Fairwind Program,向政府、Google Cloud 客户和可信网络安全伙伴限量开放网络防御能力。该计划将 Gemini 3.8 Flash Cyber 与 CodeMender 结合,用于自主发现、验证和修复漏洞,并在安全云环境中生成可部署补丁。计划已有超过 650 家合作伙伴参与,接入组织须限制使用人员并部署多因素认证等保护措施。
推荐理由:原文说明了 Fairwind Program 的服务对象、核心工具与接入限制,便于理解其面向政府和企业的部署方式。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者面向长程编码与智能体工作流,后者面向网络安全。
推荐理由:文章同时给出 Gemini 3.8 Flash 在长程编码与多步推理上的基准表现,以及 Cyber 版本的漏洞发现、修复和使用门槛,便于比较两种定位。
AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。
推荐理由:BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。
Google Research 与 NASA JPL 介绍 MAPL-EMIT,利用深度学习分析 NASA EMIT 高光谱数据,自动检测、增强量预测并定位全球甲烷羽流。
推荐理由:文章展示了物理模拟与视觉 Transformer 如何结合 EMIT 数据识别甲烷羽流,并以 84% 召回率和公开数据、模型与推理库说明其可复用性。
Google DeepMind 发布 agentic video understanding,面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,用于视频分析。
推荐理由:文章给出 agentic video understanding 的工作机制、基准变化与接入方式,便于评估长视频分析的成本和开发门槛。
Hugging Face 发布 JavaScript 库 @huggingface/kernels 和浏览器 GPU 基准测试套件 Fleet,并在 Hugging Face Hub 提供首批 207 个 WebGPU kernels。
推荐理由:文章同时给出 207 个 kernel 的版本化组织方式、Fleet 众测机制和 ORT WebGPU 对比数据,便于理解浏览器推理性能优化的落地路径。
Google Research 发布 TimesFM-3,这是一款原生支持多变量预测的时间序列基础模型,拥有 330 million 参数,并在超过 1 trillion 个时间点的数据上预训练。
推荐理由:TimesFM-3 将多变量预测、已知未来协变量与单次前向推理结合,并在三个公开基准上比较点预测和概率预测表现。
GigaPath-Flash 和 GigaTIME-Flash 通过蒸馏骨干降低病理研究的计算成本,支持人群规模发现。GigaPath-Flash 在切片分类基准上与原模型的分数差距在 3% 内,所需计算量约少 50 倍。两者均以 Apache 2.0 许可开源,仅供研究,未经过临床用途验证。
Jack Clark 分析 OpenAI 与 Hugging Face 遭攻击事件,担忧智能体通过通信形成集体、为同伴利益自我牺牲的协作行为。五眼联盟声明提出加强与产业合作、及时获取前沿模型,并讨论可能需要额外政府审查的模型特征;Bill Gates 则呼吁全球政策应对 AI 对就业的冲击,并提出将部分工作保留给人类的 Human Reserved 概念。
Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。
推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。