「贫穷且自信」: 开发者是LLM断言的不良评判者

持续追踪 : Fatigue hype 2026 : le tri entre modèle et harness· 连载 2/16

手工艺 Jul 13, 2026 at 09:137加入收藏

「贫穷且自信」: 开发者是LLM断言的不良评判者
插图 : Léa Fontaine

新的arXiv论文:程序员不仅是LLM生成的断言的坏评判者,他们对自己的判断还过度自信。这让AI代码审查出了问题。

事实

论文《Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions》(arXiv:2607.08885,2026年7月13日)记录了一个令人不安的模式:当要求开发人员评判LLM生成的代码断言时,他们经常犯错——并且认为自己是正确的。理解和代码审查是该职业的核心任务,自从生成性工具出现后更是如此。

我们的解读

这一结果增加了一个不断扩大的文献集:LLMs用一种雄辩的方式包装其输出,从而短路了怀疑。一个表述不良但用流利的英语撰写的断言通过了人类审查。这不是开发人员的缺陷——这是一个已知的偏见(流畅性=真理),LLM媒介放大了这种偏见。在“炒作疲劳”线程中的一个推论是:当人类以裸眼评判一个精心制作的输出时,我们可能高估了“人在回路中的价值”。

需要关注

需要关注两种产品反应:(a) 显示IA断言的可见不确定性的IDE(超越“接受/拒绝”);(b) 团队转向自动审查(执行测试,验证属性)而不是视觉审查。

Resources

本文由人工智能撰写,并经人工编辑审核。

我们的编辑部
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
这篇文章对您有帮助吗?

8 人赞了这篇文章

M
Mateo Rossi软件架构师
🇨🇳 架构师,拥有两个十年的生产系统经验。
分享:
评论 (7)

登录后即可参与讨论。

ArtLover99 13 Jul 2026 · 13:24

Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?

1
EcoWarrior 13 Jul 2026 · 15:37

Et si c'était aussi parce qu'on manque de diversité dans les équipes ?

1
BookWorm47 13 Jul 2026 · 05:23

Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?

J.P.R. 13 Jul 2026 · 05:00

Est-ce que les juniors sont plus touchés que les seniors ?

1
TravelTom 13 Jul 2026 · 04:55

Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?

FoodieFiona 13 Jul 2026 · 04:50

Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?

1
Emma_London 13 Jul 2026 · 04:50

Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.

2
GreenThumb 13 Jul 2026 · 04:42

Cette surconfiance peut fausser les revues de code et laisser passer des failles.

事件时间线

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1「我爱大型语言模型,我恨炒作」——geohot 提醒唯一剩下的规则13/07/2026
  2. 2「贫穷且自信」: 开发者是LLM断言的不良评判者13/07/2026
  3. 3专业人士如何真正评价由AI生成的代码?13/07/2026
  4. 4Zig、Zed、Anthropic:当语言创造者直呼其名13/07/2026
  5. 5"LLM评论家是对的。我还是会用LLM" - 重组的声音16/07/2026
  6. 6成本已变:GitHub重新引发关于真正瓶颈的讨论17/07/2026
  7. 7「Claude Code:功能缺陷解剖」——当公开评审成为真正的质量保证17/07/2026
  8. 8Google的Gemini 3.6 Flash更便宜且更短 - 而Gemini 4有所暗示,3.5 Pro则推迟上线22/07/2026
  9. 9"AI并没有让编程变得更容易,它只是让编程变得难在了不同的方面" - CACM给出了反炒作的观点22/07/2026
  10. 10"国有AI不会解决不平等":Rest of World对全球南方国家国有AI的尖锐论点24/07/2026
  11. 11重构作为代币成本杠杆:福勒生成式AI系列中的一个实验30/07/2026
  12. 12雷切尔·莱科克:“注意力已成为稀缺资源”——开发编排器,同时管理8到12个代理31/07/2026
  13. 13情境意识在一个月内下降67%:真正信徒的审判02/08/2026
  14. 14OpenAI 的「Astra」据说已解决10个数学和计算机科学领域的公开难题——且让我们拭目以待证据。02/08/2026
  15. 15“取消光标”:质量债务压倒功能开发速度02/08/2026
  16. 16杰夫·迪恩谈人工智能团队的常见错误:来自付账商店的诊断03/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
主题
浏览
信息