跳到正文

#数据/训练

今日 1 条
5月2日周六
4月22日周三
4月16日周四
4月9日周四
  1. Google Research64

    ConvApparel:Google Research 评估并缩小用户模拟器的真实性差距

    Google Research 提出 ConvApparel 数据集与三柱评估框架,用于衡量 LLM 用户模拟器与真实用户行为之间的真实性差距。该数据集包含 apparel shopping 领域超过 4,000 段人机多轮对话和近 15,000 个 turns,并通过 Good 与 Bad 两类推荐智能体收集不同用户体验。

    推荐理由:ConvApparel用真实用户反馈和反事实验证检验模拟器能否适应未见过的糟糕交互,为评估用户模拟真实性提供了可复用框架。

4月1日周三
  1. Google Research60

    Google Research 研究 AI 基准中每项需要多少名评测者

    Google Research 研究 AI 基准中评测项目数量与单项人工评测者数量的取舍,发现常用的 1、3 或 5 名评测者往往不足。研究通过模拟不同预算和数据集指出,若关注多数投票,增加项目数量通常更有效;若要捕捉完整意见范围,则需要增加每项评测者数量。根据指标优化分配后,约 1,000 次总标注即可获得高度可复现的结果,研究团队还在 GitHub 开源了模拟器。

    推荐理由:研究把评测项目数量与单项评测者数量放在同一预算框架下比较,为主观任务设计更可复现的 AI 基准提供了可操作依据。

3月25日周三
  1. Google Research50

    S2Vec 如何学习城市的空间语言

    Google Research 介绍了 S2Vec,这是一种通过自监督学习生成建成环境通用嵌入向量的框架,可用于预测人口密度和收入等社会经济指标。评测显示,S2Vec 在未见区域的社会经济预测中表现有竞争力,与图像嵌入融合通常优于单一模态;在树木覆盖率和海拔等环境任务上,仅依靠建成环境数据仍有限。

3月17日周二
  1. Mistral AI67

    Mistral AI 发布 Mistral Small 4 并加入 NVIDIA Nemotron Coalition

    Mistral AI 发布 Mistral Small 4,并作为创始成员加入 NVIDIA Nemotron Coalition。Mistral AI 与 NVIDIA 计划结合模型架构、计算资源、开发工具和合成数据管线,共同开发开放的前沿 AI 模型。联盟首项计划是在 NVIDIA DGX Cloud 上训练基础模型,为即将推出的 NVIDIA Nemotron 4 家族提供开放基础。

    推荐理由:材料把 Mistral AI 的模型发布与 NVIDIA Nemotron Coalition 的合作安排放在一起,交代了开放模型共建的参与方式和后续方向。

3月13日周五
3月12日周四
  1. Google Research77

    Google 以 AI 驱动的突发洪水预报保护城市

    Google 宣布在 Flood Hub 推出城市突发洪水预报,可提前最多 24 小时预测风险,将覆盖范围从河流洪水扩展至城市突发洪水。团队使用 Gemini 从公开新闻中提取洪灾发生地点和时间,构建 Groundsource 数据集,用于训练和评估结合天气、地理及城市化特征的 LSTM 模型。

    推荐理由:利用新闻报道重建历史洪灾样本,为缺乏传感器记录的地区提供了训练数据,也展示了非结构化资料转化为预测依据的方法。

  2. Google Research79

    Google Research 推出 Groundsource,构建2.6 million条城市山洪历史记录

    Google Research 推出 Groundsource,利用Gemini从80种语言的新闻报道中提取并核验山洪事件,构建覆盖150多个国家、从2000年至今的2.6 million条历史记录。该开放数据集可用于城市山洪建模与预测,Google还在Flood Hub中推出最长提前24小时的近全球城市山洪预报。人工复核显示,60%的事件在地点和时间上均准确,82%达到实际分析可用程度。

    推荐理由:Groundsource展示了如何用Gemini把分散的新闻报道整理为可验证的灾害历史数据,并连接到山洪预测等实际应用。

9月1日周一
  1. Berkeley AI Research59

    word2vec 究竟学到了什么?理论显示其特征学习近似 PCA

    一篇新论文为 word2vec 的学习过程建立了闭式理论,指出在特定近似条件下,其训练可化为无权最小二乘矩阵分解,最终学习到的表示对应目标矩阵的主成分。理论显示,模型从小初始化开始,会按离散步骤逐个学习正交线性概念并增加嵌入矩阵的秩;在类比补全基准上,近似模型达到 66% 准确率,原始 word2vec 为 68%。

8月1日周五
7月23日周三