乐于分享
好东西不私藏

AI能否真正完成价值100万的软件外包工作?

AI能否真正完成价值100万的软件外包工作?



想象一下:

有一家大公司,手里有很多电脑程序的问题。

他们拿出了一堆真实的软件任务,告诉 AI:

“你现在就是程序员,请你帮我们修好这些问题。如果你做得好,就相当于完成价值100万美元的软件工作。”

这些任务不是随便编的,而是真实公司以前花钱请程序员做的事情。



第一件事:AI很聪明,但还不是超级程序员

AI有一个优点:

它看代码特别快。

比如:

老师给你一本很厚的故事书,让你找:

“小明为什么突然不开心?”

普通人可能要翻很久。

AI可能几秒钟就找到:

“问题可能在第20页、第50页、第80页。”

所以:

✅ 找问题在哪里,AI很厉害。



但是,如果继续问:

“为什么小明真正不开心?请解决这个问题。”

AI就容易出错。

它可能说:

“小明不开心,是因为没人陪他。”

然后帮他买个玩具。

但是实际上:

小明不开心可能是因为考试没考好。

也就是说:

AI经常找到“表面问题”,但不一定找到“真正原因”。



第二件事:AI像一个聪明的助手,还不像一个独立工程师

论文测试了两种能力。

第一种:

让AI自己修程序。

就像:

“这里有一个坏掉的机器人,你负责修好。”

结果:

AI可以修一些简单问题。

但是遇到复杂问题,比如:

一个错误藏在很多文件里面,很多地方互相影响。

AI容易:

* 改错地方;
* 漏掉重要步骤;
* 修好了一个地方,却让另一个地方坏掉。



第二种:

让AI当“小组长”。

比如:

三个程序员提出三个解决办法。

AI负责判断:

“哪个方案最好?”

这个任务AI表现更好。

因为:

选择答案比自己动手完成更容易。

就像:

老师给你三个作文:

A、B、C。

让你选最好的一篇。

可能比较容易。

但是:

让你自己写一篇优秀作文,就难很多。



第三件事:AI多试几次,会变聪明很多

研究发现:

如果AI只尝试一次:

可能失败。

但是如果让它:

第一次失败 → 修改方法 → 再试一次 → 再改进

效果会明显提高。

就像小朋友做数学题:

第一次算错。

检查。

第二次改。

第三次终于做对。

AI也需要这种“不断尝试”的过程。



第四件事:未来公司可能这样用AI

以前:

公司请程序员:

发现问题 → 分析 → 修改 → 测试。

未来可能变成:

AI:

1. 先检查问题;
2. 尝试修复;
3. 自动运行测试;
4. 如果成功,就提交;
5. 如果失败,再交给人。

人类程序员不用处理所有小问题,只处理AI解决不了的大问题。

https://arxiv.org/abs/2502.12115