安thropic的概念推理指数针对基准污染问题
Anthropic 发布了一个新的评估框架,旨在测试抽象推理能力而非模式匹配训练数据——这是针对 MMLU 饱和问题的直接回应。
Aug 18, 2026 at 09:30 10 12
Anthropic 发布了一个新的评估框架,旨在测试抽象推理能力而非模式匹配训练数据——这是针对 MMLU 饱和问题的直接回应。
Aug 18, 2026 at 09:30 10 12
信息流架构演讲指出,上下文质量已成为新的延迟瓶颈——大多数团队过度关注窗口大小,而忽视了信号密度。
Aug 14, 2026 at 18:59 9 11
Nscale收购了Ray背后的公司——ML团队实际编写的开源分布式计算框架。收购的目的是获得地位,而非代码。
Jul 30, 2026 at 19:38 13 14
第一个开放权重模型Thinking Machines Lab(Mira Murati)已上线:Inkling,MoE 975B参数(41B活跃),多模态,Apache-2.0许可证。前沿领域最低调的公司以开放市场的方式大步进入。
Jul 16, 2026 at 21:46 25 8
一个稀疏注意力内核,使长上下文训练终于变得经济高效——如果基准测试能够在实验室外保持。
Jul 13, 2026 at 02:20 3 11