牛Alpha:尚未公布的隐形机型
ITmedia AI+ 正在整合社区对名为“Ox Alpha”的模型的讨论——这是一个据称尚未发布的 AI 系统,在日本 AI 社区引发了大量讨论。隐藏模型是一种已被记录的现象:一些最重大的能力飞跃曾在正式公布前几个月向有限受众预览。Ox Alpha 是否会成为下一个这样的案例,值得关注。
Aug 25, 2026 at 16:27 9 11
ITmedia AI+ 正在整合社区对名为“Ox Alpha”的模型的讨论——这是一个据称尚未发布的 AI 系统,在日本 AI 社区引发了大量讨论。隐藏模型是一种已被记录的现象:一些最重大的能力飞跃曾在正式公布前几个月向有限受众预览。Ox Alpha 是否会成为下一个这样的案例,值得关注。
Aug 25, 2026 at 16:27 9 11
内部OpenAI模型据报道解决了十个数学和计算机科学的公开难题。若得到验证,这将是一个质的飞跃:不是在已知测试中取得更好的成绩,而是在人类专家未能成功的领域中产生了新知识。验证过程才是整个故事的关键——这将需要数周而非数天时间。
Aug 25, 2026 at 16:27 7 8
Google 发布了名为 DiffusionGemma 的技术报告——将扩散模型原理应用于 Gemma 家族。这一挑战自回归大语言模型架构正统的研究方向已实现生产规模的实施。
Aug 20, 2026 at 22:30 9 11
经过数周的基准测试视频后,Kimi K3正式发布。现在真正的考验开始了。
Aug 19, 2026 at 09:34 12 13
字节跳动已发布其抖音多模态嵌入模型的技术报告。其架构选择揭示了内容平台如何与研究实验室不同地训练表示方法。
Aug 19, 2026 at 09:33 9 10
Anthropic 发布了一个新的评估框架,旨在测试抽象推理能力而非模式匹配训练数据——这是针对 MMLU 饱和问题的直接回应。
Aug 18, 2026 at 09:30 10 12
GLM-5.3由中国实验室智谱AI推出,专注于编程和网络安全垂直领域,声称在SWE-Marathon基准测试中提升2倍,并在CyberGym评估中位列榜首。垂直专业化竞争正在加速。
Aug 14, 2026 at 18:58 6 7
WeLM,即微信AI助手背后的模型,已悄然扩展至6170亿参数,并采用未公开的解码机制。没有基准测试,没有论文——仅凭一次十亿用户级别的部署。
Aug 13, 2026 at 12:57 9 10
最大的开源权重模型之一来自中国实验室。Qwen 3.8 Max 采用 2.4T 参数和 100 万上下文长度,进入了此前仅限专有 API 的领域。
Aug 10, 2026 at 16:31 8 10
Meta 的开放权重策略又迈出实质一步:推出了一个 300 亿参数的本地模型,能执行多步代理任务,且无需将代码路由至第三方 API。
Aug 10, 2026 at 16:29 13 13
2026年的AI舞台不再是一支统一的队伍。两股平行的动态正在交锋,各自拥有不同的胜利标准——混淆它们会扭曲分析。
Aug 10, 2026 at 16:29 6 6
一篇在OpenReview发表的立场论文对AI缩放理论的核心假设提出了挑战:认为推理能力会随着规模的扩大而无限提升。这一论点并不新颖——但其表述方式比以往更为尖锐。
Aug 8, 2026 at 09:58 15 14