
想象一下:
有一家大公司,手里有很多电脑程序的问题。
他们拿出了一堆真实的软件任务,告诉 AI:
“你现在就是程序员,请你帮我们修好这些问题。如果你做得好,就相当于完成价值100万美元的软件工作。”
这些任务不是随便编的,而是真实公司以前花钱请程序员做的事情。
⸻
第一件事:AI很聪明,但还不是超级程序员
AI有一个优点:
它看代码特别快。
比如:
老师给你一本很厚的故事书,让你找:
“小明为什么突然不开心?”
普通人可能要翻很久。
AI可能几秒钟就找到:
“问题可能在第20页、第50页、第80页。”
所以:
✅ 找问题在哪里,AI很厉害。
⸻
但是,如果继续问:
“为什么小明真正不开心?请解决这个问题。”
AI就容易出错。
它可能说:
“小明不开心,是因为没人陪他。”
然后帮他买个玩具。
但是实际上:
小明不开心可能是因为考试没考好。
也就是说:
AI经常找到“表面问题”,但不一定找到“真正原因”。
⸻
第二件事:AI像一个聪明的助手,还不像一个独立工程师
论文测试了两种能力。
第一种:
让AI自己修程序。
就像:
“这里有一个坏掉的机器人,你负责修好。”
结果:
AI可以修一些简单问题。
但是遇到复杂问题,比如:
一个错误藏在很多文件里面,很多地方互相影响。
AI容易:
* 改错地方;
* 漏掉重要步骤;
* 修好了一个地方,却让另一个地方坏掉。
⸻
第二种:
让AI当“小组长”。
比如:
三个程序员提出三个解决办法。
AI负责判断:
“哪个方案最好?”
这个任务AI表现更好。
因为:
选择答案比自己动手完成更容易。
就像:
老师给你三个作文:
A、B、C。
让你选最好的一篇。
可能比较容易。
但是:
让你自己写一篇优秀作文,就难很多。
⸻
第三件事:AI多试几次,会变聪明很多
研究发现:
如果AI只尝试一次:
可能失败。
但是如果让它:
第一次失败 → 修改方法 → 再试一次 → 再改进
效果会明显提高。
就像小朋友做数学题:
第一次算错。
检查。
第二次改。
第三次终于做对。
AI也需要这种“不断尝试”的过程。
⸻
第四件事:未来公司可能这样用AI
以前:
公司请程序员:
发现问题 → 分析 → 修改 → 测试。
未来可能变成:
AI:
1. 先检查问题;
2. 尝试修复;
3. 自动运行测试;
4. 如果成功,就提交;
5. 如果失败,再交给人。
人类程序员不用处理所有小问题,只处理AI解决不了的大问题。
https://arxiv.org/abs/2502.12115
夜雨聆风