Microsoft Research 发布并开源 RetroChimera 逆合成模型
Microsoft Research 发布 RetroChimera 逆合成模型,通过学习重排 R-SMILES 2 与 NeuralLoc 的预测,生成小分子合成路线。Nature 论文报告了其对罕见反应类型的召回、zero-shot transfer 和专有数据集微调结果,模型已在 GitHub 以 MIT license 开源,并可通过 Microsoft Foundry 使用。
Microsoft Research 发布 RetroChimera 逆合成模型,通过学习重排 R-SMILES 2 与 NeuralLoc 的预测,生成小分子合成路线。Nature 论文报告了其对罕见反应类型的召回、zero-shot transfer 和专有数据集微调结果,模型已在 GitHub 以 MIT license 开源,并可通过 Microsoft Foundry 使用。
ALTK-Evolve 新增 Consistency Analyzer 和 consistency guidelines,用于诊断并降低 ReAct agent 重复执行同一任务时的 consistency gap。
推荐理由:文章把平均成功率与重复运行可靠性拆开衡量,并给出无需端到端重放任务的诊断与修复流程,便于评估生产智能体的稳定性。
AllenAI 介绍 BenchMIRT,一种在单个提示词和任务层面审计 LLM 基准测试、拆分潜在能力信号的方法。该方法基于 100 个 LLM、16 个基准和超过 34K 个问题训练,独立识别出安全与通用推理两个主要维度。实验显示,保留 10% 的问题通常能接近完整评测的能力判断,预测未观测问题正确率为 79%,高于简单基线的 70%。
推荐理由:BenchMIRT将基准分数拆解到模型能力与单个题目层面,帮助研究者识别安全和推理信号的混杂,并压缩评测规模。
Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。
推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。
ALTK-Evolve 在 AppWorld 的八模型评测显示,智能体记忆的合适剂量取决于模型能力:强模型适合完整指南集,较弱模型适合固定核心加按任务检索,已饱和模型未见可测增益。
推荐理由:文章用 AppWorld 上八个模型的对比,说明智能体记忆应按模型能力校准,并展示完整指南集与精选检索在效果和 token 成本上的差异。
Hugging Face组织的社区挑战在19天内复现了2,226篇ICML 2026论文,发布6,816份Trackio logbook并判定35,908条科学主张。
推荐理由:这篇复盘以大规模复现数据呈现智能体审查论文的能力边界,并具体说明人类如何通过设定环境和校验关键假设提升结果可靠性。
Multiverse Computing 的论文提出离线缓存教师模型的 top-100 logits,并使用 fused chunked KL loss 降低大语言模型知识蒸馏的显存占用。
推荐理由:文章将离线 top-100 logits 缓存与 fused chunked KL loss 结合,展示其如何降低长上下文蒸馏的显存和训练成本。
IBM Research 将 K-Search 扩展为支持 MLX 的后端,并通过结构化 CUDA-to-MLX 翻译层,把 CUDA 内核优化经验迁移到 Apple Silicon。
推荐理由:文章展示了如何把 CUDA 内核中的优化经验结构化迁移到 MLX,并以 Attention 和 Mamba SSM 实测说明翻译层对 Apple Silicon 性能的影响。
ScarfBench 是一个用于评估 AI 智能体执行企业 Java 跨框架迁移的开放基准,覆盖 Spring、Jakarta EE 和 Quarkus。基准包含 34 个应用、204 个迁移任务和约 151K 行代码,要求应用完成构建、部署并通过行为验证;当前最强智能体的行为成功率仍低于 10%。
推荐理由:ScarfBench把企业 Java 框架迁移拆成构建、部署和行为验证,揭示编码智能体在可编译代码之外仍受配置与运行环境依赖影响。
Google Research 的新论文提出 MoGen,通过 PointInfinity point cloud flow matching 将随机 3D 点云逐步生成神经元形状,并用于增强 PATHFINDER 训练。
Berkeley AI Research介绍 SPEX 和 ProxySPEX,用稀疏性、低阶性与层级结构,在大规模消融中定位影响 LLM 行为的关键交互。ProxySPEX 在保持 SPEX 性能的同时约减少 10x 消融,并被用于特征归因、训练数据归因和注意力头归因。两套算法已集成到 SHAP-IQ 仓库。