AINews:Jev 发布 2 天内出现 6 个复现项目
Latent Space 汇总称,Jev 发布后 2 天内出现 6 个复现项目,路线包括 ModernBERT、Diffusion 和基于 Qwen3.5、Qwen2.5 的方案。
Latent Space 汇总称,Jev 发布后 2 天内出现 6 个复现项目,路线包括 ModernBERT、Diffusion 和基于 Qwen3.5、Qwen2.5 的方案。
Google Research 介绍 MilleMiglia,这是一个用 C++ 编写、用于生成现实中程物流问题基准实例的开源生成器。它通过空间分布、需求和车辆运行等统计分布生成隐私保护数据,并在统一格式中纳入固定时刻表、配送中心吞吐量限制和跨车辆同步约束。
GitHub Podcast 最新一期拆解五个 AI 热点观点,认为 AI 生成的代码仍需审查,Skills 与 MCP、RAG 并非互相替代。代码审查应按风险分配精力,开发者仍需理解并对结果负责。MCP 负责连接工具和数据,Skills 提供流程与专业知识,RAG 用于检索模型训练数据之外的相关信息。
OpenAI 推出《澳大利亚青少年安全蓝图》,提出一份包含六大支柱的路线图,旨在打造更安全的 AI 体验。该蓝图聚焦保护并赋能年轻人。
AINews 汇总 9/16—9/17 的 AI 动态,重点涉及 Anthropic 的 Claude Code Projects、Google 的托管智能体基础设施、OpenAI 的 Astra for Law,以及多智能体研究与 AI 安全控制。
Google Research 分享一项研究实验,利用为教育优化的生成式 UI,让教师按课程目标动态创建定制的互动学习模拟。研究团队同时发布了30多个英文 STEM 学习互动内容,覆盖物理、化学、生物和数学,并由教师审核。对12名美国教师的初步研究中,互动内容质量平均评分为8分(满分10分),Google 还将通过试点项目继续收集学校反馈。
推荐理由:文章将生成式 UI、分级挑战和分层指导纳入教师主导的流程,并结合教师审核与试点数据,呈现定制化 STEM 练习的实现路径。
Pawprint Studio 的免费开放世界生物捕捉 RPG《Aniimo》于本周登陆 GeForce NOW,支持 Steam Deck、Firefox 等设备串流,无需等待 45GB 下载。
Cooley 借助 ChatGPT Work 构建 GO Public,将智能能力引入 IPO 流程,帮助律师更早发现问题,并将判断集中在更关键的环节。
AI News 报道,Steve Yegge 关闭 Gas Town;Databricks 将 GPT-6 Astra 推广至约 3,500 名工程师后,编码支出增加约 60%。
GitHub Copilot 团队使用 GitHub Copilot app 和 Copilot CLI,将 Copilot agent runtime 从 TypeScript 重写为超过 800,000 行生产 Rust,主要代码由 AI agents 编写,历经 128 个 pull requests,并在数月内由一名开发者主导完成。
推荐理由:文章以 GitHub Copilot runtime 的 Rust 重写为案例,梳理渐进式迁移、跨语言互操作和人机协作中的具体做法。
OpenAI 推出面向法律领域的 Astra。OpenAI for Law 提供前沿智能、定制化律所工作流、互联法律数据源,以及用于保密客户工作的法律级控制。
AIUC 联合创始人 Rune Kvist 宣布公司完成由 Ribbit Capital 和 First Harmonic 领投的 $40M Series A,并介绍其面向 AI 智能体的 AIUC-1 标准。
OpenAI 分享了一套用于跟踪、调查和披露模型不对齐事件的框架,并附带六份关于模型出现意外或令人担忧行为的报告。
OpenAI 与 AARP 将在10座美国城市为1,000名老年人提供免费的实践型 ChatGPT 工作坊,帮助参与者安全掌握实用 AI 技能。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中首次提交预览结果,在 Qwen3-VL 上的吞吐量最高达到 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上最高达到 2.5x。
推荐理由:文章将 Vera Rubin NVL72 的模型吞吐、GB300 NVL72 的跨机架扩展效率与软件优化增益放在同一组 MLPerf 结果中,便于比较推理基础设施的长期经济性。
Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动能够根据电网状况动态调整用电的数据中心。联盟将围绕响应速度、持续时间、可预测性和应急行为制定技术要求、性能指标与数据共享规范,并探索更快的 AI 基础设施并网路径。
推荐理由:联盟把 AI 数据中心的电力灵活性转化为可衡量的接入要求,为开发者与电网运营方协作提供共同框架。
OpenAI 展示了由 AI 驱动的新型广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。
Mistral 宣布与 Mozilla 合作,为 Firefox Smart Window 提供模型支持,帮助用户处理复杂搜索、找回浏览内容并根据浏览器标签整理信息。该功能目前面向法国和北美用户,英国和德国预计 later this year 推出;对话默认不保存在 Mozilla 服务器,Mistral 同意 zero data retention。
推荐理由:文章交代了 Firefox Smart Window 的模型来源、覆盖地区与隐私安排,也呈现了浏览器 AI 在开放分发和用户控制上的合作思路。
Hex 使用 GPT-6 Astra,让其数据智能体将分析答案转化为员工愿意分享的交互式可视化内容。GPT-6 Astra 帮助 Hex 将复杂分析呈现为可视化报告。
ChatGPT Work 和 Codex analytics 帮助团队了解 AI 的使用情况与支出,并将 AI 采用情况与业务成果建立联系。相关分析还能识别团队的培训需求。
TypeSafe 发布 Jev,一款通过 RLCD 训练、面向结构化决策而非文本生成的模型。文章称其速度和成本显著低于小型 frontier LLM,但 Jev 不能生成自由文本,并要求预定义输出格式。全文还汇总了 Neon、Gemini 3.8 Live、智能体基础设施与 CheatBench 等近期 AI 动态。
OpenAI 经济研究显示,员工正在传统职责之外使用 AI,新的工作活动也成为其工作中反复出现的组成部分。研究关注员工如何拓展 AI 的使用方式,以及哪些新活动会持续融入日常工作。
曼彻斯特大学与 NVIDIA Earth-2 团队利用 Earth-2 CorrDiff 和 StormCast,训练可预测英国空气污染的生成式模型。模型基于一年、按小时模拟的英国污染数据,可达 2-3 square kilometers 分辨率,并在 Isambard-AI 的单个八 GPU 节点上用两天完成训练。
Salesforce 发布首个 CRM 推理模型 Koa,该模型基于 NVIDIA Nemotron 3 Super,并使用近三十年企业 CRM 部署生成的专有合成数据进行后训练。
推荐理由:文章梳理了 Koa 的训练来源、数据隔离和 CRM Bench 表现,并交代了客户试点与正式可用时间。
Good Start Labs 的实验显示,模型在游戏中学到的部分技能可以迁移到现实工作任务,但迁移范围和可靠性仍不明确。在 1830 铁路策略游戏训练中,只有使用工具探索环境、规划策略并实时适应的 terminal-agent 设计提升了 Finance-Agent benchmark;作者还提到 Diplomacy 训练改善了客户支持表现。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本对话和高复杂度任务。
推荐理由:文章同时给出两款模型的定位、语音智能体基准表现与开发者入口,便于比较能力重点和落地路径。
NVIDIA介绍 DSX AI 工厂平台,通过动态功耗分配、工作负载调度和电网响应,在固定电力预算下提高 token 吞吐。Lambda 在 HGX B200 五机架、19 节点集群上实现了 24% 的集群 token 吞吐提升和 23% 的每瓦性能提升。
推荐理由:文章将 DSX 的功耗调度、需求响应和 800V DC 架构放在同一套 AI 工厂框架中,并给出 Lambda 的吞吐与性能功耗数据。
ALTK-Evolve 新增 Consistency Analyzer 和 consistency guidelines,用于诊断并降低 ReAct agent 重复执行同一任务时的 consistency gap。
推荐理由:文章把平均成功率与重复运行可靠性拆开衡量,并给出无需端到端重放任务的诊断与修复流程,便于评估生产智能体的稳定性。
Fyxer 使用 OpenAI 模型、微调、记忆和真实用户反馈,打造用户信赖的 AI 执行助理。该产品可整理收件箱,并以每位用户的口吻起草邮件。
Perplexity 使用 GPT-6 Astra 撰写通信内容、修改软件并监控生产系统,将更多端到端工作交给模型完成。相比早期模型,Perplexity 对 Astra 的人工检查频率大幅降低。
GitHub 日本和韩国市场的营销负责人使用 GitHub Copilot,将活动策划、报名筛选和会后跟进串成由 GitHub Issue 触发的自动化流程。GitHub Actions 负责创建落地页、生成 UTM 链接、处理名单和更新项目看板,GitHub Copilot skills 则以 SKILL.md 描述灵活的会后步骤。
推荐理由:文章给出一套从 Issue 表单、标签和 Actions 到 SKILL.md 的营销自动化实践,展示如何在保留人工审批的同时减少跨工具重复操作。
Cognition 借助 GPT-6 Astra 提升 Devin 测试软件并证明其可运行的能力,旨在帮助工程师减少代码审查、交付更多软件。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,服务 1 billion ChatGPT 用户并承载 22M requests per second。Habitat 由单一库扩展为支撑 ChatGPT 在线存储服务的平台。
Google Research 在 ACL 2026 介绍 ToolGrad,通过先生成经验证的工具调用链,再标注对应用户查询,迭代构建更复杂的工具调用数据。基于 ToolBench 的 16k+ APIs,ToolGrad 以更低成本和更高通过率生成数据;使用 ToolGrad-500 微调的 Gemma-3-12B 在 BFCL 上取得 83.1 分。
推荐理由:文章清楚拆解了从工具链生成、执行筛选到查询更新的流程,并用 BFCL 结果展示该方案的训练效果与成本取舍。
GitHub Copilot app 将 diff、terminal 和 browser 作为内置面板,让用户在同一处审查 Agent 的代码变更、运行项目命令并预览网站效果。用户可以通过 Pick & Polish 工具选择界面元素并让 Agent 调整,确认功能可用后直接接受变更并创建 pull request。
推荐理由:文章把审查代码变更、运行命令和浏览器预览串成一套流程,帮助读者在接受 Agent 生成的代码前完成验证。
César de la Fuente 的实验室使用 Codex 和 ChatGPT 搜索现存及已灭绝生物的基因组,寻找可对抗耐药感染的抗菌候选分子。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可连接公司数据、发现洞察,并通过自然语言构建交互式仪表盘。
推荐理由:这项更新把企业数据连接、洞察发现和交互式仪表盘构建整合到自然语言操作中,呈现了数据智能体的主要使用场景。
Cloudera 与 Mistral 宣布合作,将专用主权 AI 引入企业数据,让客户掌控数据、模型及运行环境。Mistral 模型将集成至 Cloudera 混合数据平台,支持私有云、公有云、本地及完全隔离环境中的部署与推理。企业可在受控环境内利用专有数据训练定制模型,保有数据与生成智能的所有权。
OpenAI推出面向金融服务的ChatGPT,集成金融数据和GPT-6 Astra,用于研究、建模及制作面向客户的材料。