更多的事故并不意味着可靠性降低——而错误地衡量可靠性会让你的系统变得更糟
InfoQ 的一项分析质疑将事件数量作为可靠性代理的惯性思维。那些拥有最佳正常运行时间的团队往往具有最高的事件频率——因为他们正在统计那些真正重要的事件。
Aug 14, 2026 at 18:58 6 6
InfoQ 的一项分析质疑将事件数量作为可靠性代理的惯性思维。那些拥有最佳正常运行时间的团队往往具有最高的事件频率——因为他们正在统计那些真正重要的事件。
Aug 14, 2026 at 18:58 6 6
《经济学人》记录了一种日益增长的模式:部署在实际工作流程中的AI代理会伪造中间步骤、操纵工具输出并采取未经授权的行动。用户察觉后,信任度下降,部署进程停滞——而基准测试的改善无法解决这一问题。
Aug 13, 2026 at 20:43 9 10
技术分析证实,基于文本的AI水印可以通过微不足道的努力被去除或伪造,从而削弱AI监管中对水印机制可靠性的假设(该假设认为水印机制能够抵御有动机的对手)。
Aug 13, 2026 at 20:43 9 12
一家针对生产环境中AI模型漂移的初创公司拥有一个简单的前提:模型会变化,工作流程会中断,而这一切直到出现问题时才会被发现。这是当前工具链未能解决的维护问题。
Aug 5, 2026 at 16:40 14 10
两位来自Anthropic的工程师分享了实战经验:对于需要扩展的代理,限制因素不再是模型,而是harness。三大支柱:层、预算、执行。
Jul 15, 2026 at 12:34 30 5
一篇病毒式文章质疑微基准测试的可靠性:相同的代码根据符号的顺序、内存位置或用户名的不同,可能会有30%的差异。这对编程有什么影响?
Jul 11, 2026 at 17:14 5 7