
当前人工智能(AI)的竞争焦点,正逐渐从单纯比拼“谁最聪明”,延伸到“谁是最值得合作的对象”。
《Forbes》报道指出,评判AI的表现,已不再局限于推理能力与基准测试(Benchmark)的跑分,它在工作协作中展现的“性格”与互动方式同样关键。如今,这项特质已成为AI产品设计的核心课题。
AI开发商已开始将性格塑造视为重中之重。以Anthropic为例,他们将Claude的“性格训练”(Character Training)视为重要设计环节,并于2026年1月发布了新版Claude宪章,明文规定其价值观与行为准则将直接影响模型的训练过程。
此举不仅呼应了他们广为人知的“宪法AI”(Constitutional AI)理念,更凸显出现今的AI企业已不再只是决定模型“知道些什么”,而是着手定义它“应该成为什么样的系统”。
为何AI的性格如此重要?原因在于AI已深度参与人类的思考与决策流程。
报道引述康奈尔大学的一项研究指出,当使用者藉由带有特定立场倾向的AI助手辅助写作时,自身的观点往往也会在不知不觉中朝该方向倾斜。这意味着AI的态度会悄悄渗透进使用者的判断中,其影响力已远远超越单次对话的范畴。
同时,AI的底层能力竞争依然在快速演进,最新基准测试数据也揭示了各家巨头的技术实力。根据7月13日最新发布的BenchLM更新:
1.最强推理挑战:在评估模型理解与泛化新颖抽象规则、被誉为最难公开推理测试之一的ARC-AGI-2中,OpenAI的GPT-5.5以85%的成绩夺下领先地位。
2.软件工程实测:在SWE-Rebench软件工程基准中,Anthropic的Claude Opus 4.6以65.3%居首。
3.真实情境挑战:然而,在更贴近真实开发情境的SWE-Bench Pro公开数据集上,即便是OpenAI GPT-5与Claude Opus 4.1,最佳表现也仅落在23%左右。这显示出,面对复杂的真实世界任务,前沿模型仍面临严峻挑战。
报道最后强调,虽然市场机制与使用者普遍偏好“更讨喜、顺从”的回应,但这不一定对使用者最有实质帮助。OpenAI就曾在2025年主动撤回一项GPT-4o更新,原因正是该模型变得“过度奉承与迎合”。
这些案例在证明,AI的温度、拿捏分寸的能力,以及是否愿意在适当时机提出建设性反驳,已成为与“算力”和“准确率”并驾齐驱的重要竞争维度。在未来,最好用的AI未必是最聪明的,而是性格与应对最成熟的那一个。
夜雨聆风