Basis 借助 GPT-6 Astra 以 2 倍速度完成税务工作簿
GPT-6 Astra 完成 Basis 的 50-tab 税务工作簿,速度是 GPT-5.6 Sol 的 2 倍。其对用户意图更强的理解,让 Basis 对真实场景使用更有信心。
GPT-6 Astra 完成 Basis 的 50-tab 税务工作簿,速度是 GPT-5.6 Sol 的 2 倍。其对用户意图更强的理解,让 Basis 对真实场景使用更有信心。
OpenAI 推出 MentalHealthBench,这是一个由专家提供指导的评测基准,用于评估 AI 在贴近现实的心理健康对话中生成回复的帮助性与安全性。该基准聚焦 AI 能否在相关场景下提供有帮助且安全的回应。
GPT-6 Astra 让 Parallel 的智能体在研究并综合劳动力市场数据时,相较此前模型将所需时间和成本均降至一半。
UK AISI 使用 EvalEval 的基础设施,通过 Evaluation Cards 公开分享评测方法、结果、上下文和配置,提升评测研究的可复现性。
推荐理由:文章展示了 AISI 如何借助统一 schema 和 Evaluation Cards 公开评测配置与结果,为比较不同实验设置下的模型表现提供可复用参考。
Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。
推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。
ALTK-Evolve 在 AppWorld 的八模型评测显示,智能体记忆的合适剂量取决于模型能力:强模型适合完整指南集,较弱模型适合固定核心加按任务检索,已饱和模型未见可测增益。
推荐理由:文章用 AppWorld 上八个模型的对比,说明智能体记忆应按模型能力校准,并展示完整指南集与精选检索在效果和 token 成本上的差异。
Dharma AI 构建约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器比较;相同硬件和工作负载下,GPU 利用率最高提升33个百分点,优先级加权产出最高提升105.1%。分配器按实时需求曲线和批处理作业优先级规划整个调度周期,在64 GPUs、30 jobs的规模测试中以15 ms延迟带来15.9%的价值提升。
推荐理由:文章用七个场景比较约束感知 GPU 分配器与 FIFO 调度器,展示同等硬件和工作负载下,调度顺序如何影响利用率与优先级加权产出。
DharmaOCR 在巴西葡萄牙语 OCR 基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章将优势归因于面向巴西葡萄牙语的监督微调,以及用于降低重复和不连贯输出的 DPO 训练。
Real World VoiceEQ 发布,用于评估语音系统识别、生成和响应语音中非文本声学信息的能力。该基准覆盖 40 多个语音模型、15+ 个评测维度和 60 多项指标,并基于超过 1 million 次人类评价构建。研究发现,不同模型在技术准确性、情绪理解、表达能力和稳健性等方面各有侧重,自动评测尚不能替代涉及声学情境和社会理解的人类听评。
推荐理由:该基准以超过 1 million 次人类评价衡量语音交互质量,展示了传统指标难以覆盖的情绪、身份和真实环境表现差异。