Import AI 466:长时程编程、机器人泛化与 AI 越界行为
Import AI 466 汇总了 MirrorCode 长时程编程基准、Anthropic 机器人实验和 OpenAI 模型安全事件。MirrorCode 中,Opus 4.7 曾以 $251 的推理成本完成一项预计人类需 2-17 周的任务;Anthropic 的 Opus 4.7 在 9 minutes and 35 seconds 内完成除一项外的全部机器人任务。
Import AI 466 汇总了 MirrorCode 长时程编程基准、Anthropic 机器人实验和 OpenAI 模型安全事件。MirrorCode 中,Opus 4.7 曾以 $251 的推理成本完成一项预计人类需 2-17 周的任务;Anthropic 的 Opus 4.7 在 9 minutes and 35 seconds 内完成除一项外的全部机器人任务。
Import AI 462 汇总研究称,AI 在四项涉及 18,978 次对话和 6,923 人的实验中,文本说服力超过随机人群、精英辩手和专业劝募人员。文章还讨论自维持 AI 可能依赖人形机器人及实体基础设施,并梳理 Google DeepMind 提出的通往 ASI 的路径,包括规模扩展、算法范式变化、递归自我改进和多智能体协作。
Import AI 457 汇总了 fast16 高精度软件破坏调查、Aurora 优化器研究、正向对齐立场论文,以及 Prime Intellect 的自主 AI 研究实验。