Microsoft Research 用机器学习预测电网空间天气风险
Microsoft Research 构建了一套机器学习管线,为美国本土 66,935 座变电站生成空间天气风险估计,并可提前 30-60 分钟发出特定风险预警。
推荐理由:文章展示了从太阳风预测到变电站风险估计的完整链路,并用评估指标说明其预警能力与落地前的验证环节。
Microsoft Research 构建了一套机器学习管线,为美国本土 66,935 座变电站生成空间天气风险估计,并可提前 30-60 分钟发出特定风险预警。
推荐理由:文章展示了从太阳风预测到变电站风险估计的完整链路,并用评估指标说明其预警能力与落地前的验证环节。
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train,用离线强化学习生成与集合属性对齐的查询分解监督,再训练 53.9M-parameter 扩散检索器,在单次非自回归过程中生成完整目标集合。该方法在时延上相较自回归方法实现 12 to 20 speedup,并在大上下文批处理中将近 50 秒的自回归扇出延迟降至亚秒级到数秒。
Google Research 在 ACL 2026 介绍 ToolGrad,通过先生成经验证的工具调用链,再标注对应用户查询,迭代构建更复杂的工具调用数据。基于 ToolBench 的 16k+ APIs,ToolGrad 以更低成本和更高通过率生成数据;使用 ToolGrad-500 微调的 Gemma-3-12B 在 BFCL 上取得 83.1 分。
推荐理由:文章清楚拆解了从工具链生成、执行筛选到查询更新的流程,并用 BFCL 结果展示该方案的训练效果与成本取舍。
Google Research 基于 UK Biobank 欧洲人群和 Biobank Japan 近 200 thousand 名日本人样本,评估了八种临床性状的 PRS 跨人群迁移效果。
Google Research 与 HHMI Janelia 等合作发布了雄性果蝇大脑和中枢神经系统的完整连接组图谱,包含超过166,000个神经元和125 million个突触连接,按神经元数量计算为目前最大的脑图谱。该成果发表于 Cell,图谱经过 HHMI Janelia 人类专家标注和校验。研究人员可通过开源工具 Neuroglancer 查看、探索和下载这份数据。
推荐理由:文章展示了 AI 连接组学如何把电子显微镜切片重建为可验证的细胞级图谱,并说明雌雄连接组可用于研究神经差异和行为机制。
Google Research 与 NASA JPL 介绍 MAPL-EMIT,利用深度学习分析 NASA EMIT 高光谱数据,自动检测、增强量预测并定位全球甲烷羽流。
推荐理由:文章展示了物理模拟与视觉 Transformer 如何结合 EMIT 数据识别甲烷羽流,并以 84% 召回率和公开数据、模型与推理库说明其可复用性。
GlucoFM 是一种用于连续血糖监测(CGM)的自监督基础模型,以双流设计分离较慢的血糖趋势与短期偏差,并保留时段和缺失信息。在四个队列、七项临床预测任务的14项队列—任务评估中,其平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高5.8个百分点,并在糖尿病风险和β细胞功能障碍评估中全部领先。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩为 60B 参数并量化至 MXFP4,在 9 项基准中的 7 项超过同架构 BF16 检查点。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名聚合移动模式与地点文本表示结合,以建模地点的动态功能。在洛杉矶和休斯顿的未见地点测试中,该框架使访问意图预测相对提升最高达 81.9%,价格水平分类提升 75.1%,繁忙程度估计准确率提升 24.7%。ME-POIs 面向地点和商家的群体性聚合特征,不用于个人个性化推断。
Google Research 介绍 PhotoScan,一种从标准 2D 智能手机照片估计体脂率、A/G 比和 V/S 比的深度学习框架。模型使用 UK Biobank 的 35,323 条记录预训练,并在 677 名成人数据上微调,在 132 人的独立验证队列中评估。
推荐理由:文章比较了 PhotoScan、BIA 与 DXA 在体成分估计和胰岛素抵抗分类上的表现,呈现了智能手机图像的应用边界。
Google Research 介绍一项关于 LLM 事实性的研究,提出 knowledge profiling 和 WikiProfile,用于区分事实是否被编码及能否被召回。
推荐理由:文章用 WikiProfile 区分事实编码与召回,数据显示前沿模型的瓶颈更多在已存知识的访问,而非知识缺失。
Multiverse Computing 的论文提出离线缓存教师模型的 top-100 logits,并使用 fused chunked KL loss 降低大语言模型知识蒸馏的显存占用。
推荐理由:文章将离线 top-100 logits 缓存与 fused chunked KL loss 结合,展示其如何降低长上下文蒸馏的显存和训练成本。
Berkeley AI Research 提出 ABBEL,通过周期性更新并监督自然语言信念状态,让智能体在长程交互中用信念替代完整历史作为工作上下文。在 CollabBench 协作编码中,重构式信念评分将与完整上下文模型的性能差距缩小约50%,训练步数从100降至50,同时峰值上下文 token 长度低于完整上下文设置。
Google Research 在 Nature 发表研究,展示一种强化学习框架,可利用量子错误检测事件持续调节控制参数,在计算不中断的情况下抵抗漂移。该方法在 Willow 超导处理器上使逻辑稳定性提升 3.5 倍,并在人工校准后进一步将逻辑错误率降低 20%;模拟显示所需训练迭代次数与系统规模无关。
推荐理由:文章把量子纠错产生的错误检测事件转为强化学习信号,展示了连续校准如何在不中断计算的情况下抑制硬件漂移。
Google Research 在 ICLR 2026 论文中指出,扩散模型的创造力来自神经网络训练对 score function 产生的 score smoothing,而非随机现象。研究表明,正则化会让模型在训练数据点之间生成新的合理样本,并在高维场景中帮助恢复数据流形。Google Research 同时发布了用于生成论文图表的数值实验代码。
Google Research 在 CIDR 2025 论文中提出线性弹性缓存,将页面淘汰建模为 ski rental 问题,并根据实时负载动态调整缓存大小。在 Spanner 生产服务器的测试中,内存使用减少 15.5%,缓存未命中增加 5.5%,TCO 降低约 5%,实际 I/O 成本仅增加 0.5%。该方法使用轻量级决策树预测页面 TTL,缓存物理空间不足时仍由 LRU 管理。
Google Research 研究发现,开启 reasoning trace 可帮助 Gemini-2.5 Flash、Gemini-2.5 Pro 和 Qwen3-32B 找回关闭推理时难以恢复的单跳事实。
推荐理由:文章通过受控实验拆解推理提升单跳事实召回的两种机制,并将中间事实的可靠性与最终答案准确率联系起来。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率地图转化为包含树篱、石墙和小型林地的可操作清单。该框架使用在 300 million 全球卫星图像上预训练的 Remote Sensing Foundations Vision Transformer,并结合亚米级影像和 1-meter LiDAR 数据识别复杂农田景观。
推荐理由:文章展示了如何将高分辨率卫星影像与 LiDAR 数据转化为可用于生态恢复和碳核算的精细化地理数据。
Google Research 提出 Regularized f-Divergence Kernel Tests,用相对三样本检验审计差分隐私与机器遗忘。该框架在 SVT3 隐私违规检测中仅用几千个样本,而 DP-Auditorium 需要数百万个样本才能达到相近的检测率。对所评估的近似机器遗忘方法,只有 random label technique 通过了测试,作者同时说明实验使用了简化实现。
推荐理由:文章把机器遗忘审计从直接比较两模型改为相对三样本检验,并展示其在隐私审计中减少样本需求、识别局部偏移的具体效果。
Google DeepMind 发布新论文,介绍 Decoupled DiLoCo 如何通过异步连接多个计算“岛”提升跨数据中心训练的弹性。
推荐理由:文章展示了 Decoupled DiLoCo 如何在跨区域训练中降低带宽依赖、隔离硬件故障,并兼容不同代际芯片,为分布式预训练提供基础设施思路。
Google Research在发表于 Transactions on Machine Learning Research 的论文中提出 Simula,用推理优先的方法从第一性原理构建合成数据集。
推荐理由:文章将合成数据生成重构为机制设计问题,拆分覆盖、多样性、复杂度与质量,给出可控且可评估的数据构建路径。
Google Research 的新论文提出 MoGen,通过 PointInfinity point cloud flow matching 将随机 3D 点云逐步生成神经元形状,并用于增强 PATHFINDER 训练。
Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。
推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。
Google Research 研究 AI 基准中评测项目数量与单项人工评测者数量的取舍,发现常用的 1、3 或 5 名评测者往往不足。研究通过模拟不同预算和数据集指出,若关注多数投票,增加项目数量通常更有效;若要捕捉完整意见范围,则需要增加每项评测者数量。根据指标优化分配后,约 1,000 次总标注即可获得高度可复现的结果,研究团队还在 GitHub 开源了模拟器。
推荐理由:研究把评测项目数量与单项评测者数量放在同一预算框架下比较,为主观任务设计更可复现的 AI 基准提供了可操作依据。
Google Research 发布 TurboQuant、QJL 和 PolarQuant,用于压缩 KV cache 与高维向量搜索数据。
Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。
Berkeley AI Research介绍 SPEX 和 ProxySPEX,用稀疏性、低阶性与层级结构,在大规模消融中定位影响 LLM 行为的关键交互。ProxySPEX 在保持 SPEX 性能的同时约减少 10x 消融,并被用于特征归因、训练数据归因和注意力头归因。两套算法已集成到 SHAP-IQ 仓库。
Google Research 推出 Groundsource,利用Gemini从80种语言的新闻报道中提取并核验山洪事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。该开放数据集可用于城市山洪建模与预测,Google还在Flood Hub中推出最长提前24小时的近全球城市山洪预报。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度。
推荐理由:Groundsource展示了如何用Gemini把分散的新闻报道整理为可验证的灾害历史数据,并连接到山洪预测等实际应用。
一篇新论文为 word2vec 的学习过程建立了闭式理论,指出在特定近似条件下,其训练可化为无权最小二乘矩阵分解,最终学习到的表示对应目标矩阵的主成分。理论显示,模型从小初始化开始,会按离散步骤逐个学习正交线性概念并增加嵌入矩阵的秩;在类比补全基准上,近似模型达到 66% 准确率,原始 word2vec 为 68%。