跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 1–5 条 · 共 5 条
9月22日周二
8月28日周五
  1. Hugging Face Blog74

    Hugging Face 与 Voice Arena 为 Open ASR Leaderboard 加入 Hindi 和 Indian English 评测

    Hugging Face 与 Voice Arena 发布 Monsoon en-IN 和 Monsoon hi-IN 评测集,将 Hindi 和 Indian English 纳入 Open ASR Leaderboard。四个公开与私有切分共覆盖 4,888 名说话人,并记录 12 项说话人属性;Hindi 使用接受多种书写变体的 OIWER 评估,相关实现 voi-oiwer 也已开源。

    推荐理由:文章展示了如何将公开和私有切分、说话人元数据与 Hindi 的 OIWER 结合,用于定位不同地区和书写变体下的 ASR 误差。

8月19日周三
  1. Hugging Face Blog68

    智能体需要多少记忆?ALTK-Evolve 在八个模型上的评测

    ALTK-Evolve 在 AppWorld 的八模型评测显示,智能体记忆的合适剂量取决于模型能力:强模型适合完整指南集,较弱模型适合固定核心加按任务检索,已饱和模型未见可测增益。

    推荐理由:文章用 AppWorld 上八个模型的对比,说明智能体记忆应按模型能力校准,并展示完整指南集与精选检索在效果和 token 成本上的差异。

8月18日周二
  1. Hugging Face Blog64

    相同集群利用率提升33个百分点:GPU 分配器改变的是调度顺序

    Dharma AI 构建约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器比较;相同硬件和工作负载下,GPU 利用率最高提升33个百分点,优先级加权产出最高提升105.1%。分配器按实时需求曲线和批处理作业优先级规划整个调度周期,在64 GPUs、30 jobs的规模测试中以15 ms延迟带来15.9%的价值提升。

    推荐理由:文章用七个场景比较约束感知 GPU 分配器与 FIFO 调度器,展示同等硬件和工作负载下,调度顺序如何影响利用率与优先级加权产出。

7月15日周三
  1. Hugging Face Blog66

    Real World VoiceEQ 发布,用人类评价衡量语音 AI 的真实交互质量

    Real World VoiceEQ 发布,用于评估语音系统识别、生成和响应语音中非文本声学信息的能力。该基准覆盖 40 多个语音模型、15+ 个评测维度和 60 多项指标,并基于超过 1 million 次人类评价构建。研究发现,不同模型在技术准确性、情绪理解、表达能力和稳健性等方面各有侧重,自动评测尚不能替代涉及声学情境和社会理解的人类听评。

    推荐理由:该基准以超过 1 million 次人类评价衡量语音交互质量,展示了传统指标难以覆盖的情绪、身份和真实环境表现差异。