来源:网络更新时间:2026-06-17 10:04:51点击:
2026年美加墨世界杯战火刚刚点燃,赛场之外的AI(人工智能)赛事研判与实力比拼却早已鸣锣开道。
日前,国产大模型Kimi(月之暗面)宣布,将通过Agent(智能体)集群同时调度300个子Agent,公开预测全部104场世界杯赛事结果,并抛出“德国队或爆冷夺冠”的另类判断。与此同时,Kimi同步上线了一场Token“押注”活动——设立1万亿Tokens(词元)奖池,用户选择支持的球队后,每获胜一场即可参与瓜分Token,巧妙地将体育赛事热度与AI用户运营深度绑定。
《每日经济新闻》记者(以下简称每经记者)注意到,千问也紧随其后推出了同类预测活动。经每经记者实测,豆包、元宝、DeepSeek(深度求索)、文心一言等国产大模型在被问及“2026年世界杯谁会夺冠”时,多数给出的答案为“西班牙队”,且判断逻辑高度趋同。
热闹表象之下,Kelly Bench(大模型评估测试平台)最新数据却显示,包括ChatGPT在内的顶级模型在足球赛果预测上表现惨淡,胜率远不及随机猜测。
Kimi、千问等AI大模型为何集体“押注”世界杯?这背后,折射出AI大模型行业的集体焦虑:当写诗、做题、对话等能力的同质化竞争逼近天花板,各家厂商急于向外界证明,自己的产品能够理解复杂、动态且充满不确定性的现实世界。
借顶级赛事制造用户体验入口
面对世界杯这一全球瞩目的流量盛宴,各路品牌早已摩拳擦掌。此番下场“押注”的阵营中,除了传统赞助商,还多了手握万亿Tokens的AI大模型玩家。
近日,Kimi高调宣布将通过Agent集群同时调度300个子Agent公开预测赛事结果,并在每轮赛前公布预测、赛后进行复盘。Kimi的预测策略并未完全随波逐流——它同样认为西班牙队和法国队是夺冠最大热门,但同时抛出一个独特视角:德国队的夺冠概率可能被市场严重低估。
当网友们热议“AI预测究竟准不准”“AI到底懂不懂球”时,Kimi在活动伊始便坦承“我们的预测很可能是错的”,并称希望通过这次尝试,将分析过程、预测结论与赛后复盘置于同一透明框架中接受检验。
此外,Kimi还拿出1万亿Tokens设立奖池,用户预测冠军队或挑选的球队每获胜一场即可参与瓜分。截至6月11日18时,Kimi App(应用程序)实时排行显示,支持率TOP5的队伍分别为阿根廷、法国、西班牙、巴西、葡萄牙,其中43.33%的参与用户选择了阿根廷。
那么,Kimi“押注”世界杯并豪掷万亿Tokens,究竟是能力展示,还是一场品牌营销?
长期关注世界杯等顶级赛事的体育咨询专家、关键之道创始人张庆告诉每经记者,Kimi此次活动的逻辑类似于春晚抢红包、集福瓜分奖金等互联网平台经典打法,本质上更偏向营销活动。
“每一届世界杯都是一个巨大的流量池,各家企业都希望借此获得更多曝光和引流机会。而大模型天然适合做这类数据分析和预测。”张庆向每经记者指出,当前大模型赛道竞争白热化,尤其是围绕用户注意力和使用频次的争夺。借世界杯契机,一方面能加持品牌声量,另一方面也有利于提升用户积累和活跃度。
深耕人工智能产业多年的技术专家王岩(化名)在接受每经记者采访时坦言,大模型预测世界杯冠军,本质上是体育热点、Token补贴与Agent能力展示三者叠加形成的传播事件。
王岩认为,热点借势只是入口,真正的竞争焦点在于谁能将抽象的模型能力转化为用户可感知的结果。这意味着,AI大模型企业在品牌传播上已不再满足于发布参数、榜单和技术报告,而是转向借高关注度赛事制造用户体验入口。在商业层面,各家争夺的则是用户心智、使用频次、社交传播力和开发者注意力。
截至目前,究竟有多少用户参与了Kimi“押注”世界杯的活动?通过Agent集群预测赛事,Kimi又将获得哪些能力维度的提升?Kimi方面向每经记者表示“暂无回应”。

多款大模型集体“押宝”西班牙队
不只是Kimi,其他AI大模型玩家也试图在世界杯流量中分得一杯羹。例如,千问同步推出“决战美加墨,与千问一起预测,赢万元现金”活动,加入了这场AI“秀肌肉”的争夺战。
“我前两天也用DeepSeek、豆包预测了今年世界杯冠军,想对比它们谁分析得有道理,但看到的预测结果和相关理由都有明显局限性。”张庆向每经记者分享了自己的使用体验。
在国产大模型眼中,谁是今年的冠军队伍?每经记者实测DeepSeek、Kimi、豆包、元宝、千问、文心一言、智谱清言后发现:DeepSeek押宝法国队,Kimi看好阿根廷队,而千问、豆包、元宝、文心一言、智谱清言5款国产大模型则一致指向西班牙队。
各款AI大模型给出的理由略有差异,但值得注意的是,支持西班牙队的5款模型在判断逻辑上高度趋同,核心理由之一均为“权威数据模型与机构高度一致看好”。
AI预测究竟靠不靠谱?
上海财经大学特聘教授胡延平向每经记者表示,AI大模型已初步展现出基于全局动态信息和深度复杂推理的特定预测能力。“但足球是圆的,预测的成功率和精准度还有待观察。”
“世界杯冠军预测无疑是展示模型与智能体水准的绝佳机会,不过预测效果也是一把双刃剑。个人预期这届世界杯水准最高的预测模型,成功率能达到60%~80%。”胡延平说。
然而,Kelly Bench在2023~2024赛季英格兰超级联赛的模拟结果显示,其评估的每个前沿模型在整个赛季均处于亏损状态,其中不少甚至经历了“破产”。
“AI更多的是一个辅助工具,基于战队历史战绩、世界杯排名、赔率、国际足联数据等多维度信息进行统计分析,作为参考还是有意义的,但我不会完全依赖它的结果。”一位长期关注世界杯的资深球迷告诉每经记者。
在上述球迷看来,相比大模型的客观推算,每个球迷都有自己的主观偏好,喜好会在判断中占据相当大的权重,而且越到决赛阶段,越是考验球员的临场发挥和心理博弈,不确定性因素太多了。
预测冠军是Agent能力的公开压力测试
当大模型争先恐后地给出夺冠热门时,这场看似娱乐化的“AI押注战”背后,各家究竟想“秀”什么?又在集体“卷”什么?
“本轮大模型预测世界杯冠军,是生成式AI从问答工具走向公共事件运营的典型样本。”王岩向每经记者指出,公众看到的是冠军预测,企业展示的却是Agent协同、长上下文处理、实时检索、概率校准和高并发服务能力,而在商业维度上争夺的则是用户时长、付费转化和资本叙事。
当前,AI大模型的竞争早已不局限于参数榜单的比拼,而是从“会聊天”转向“能办事”,从“比模型”转向“比场景”。然而,一项覆盖全球1250多家企业的研究显示,仅5%的公司实现了AI价值的规模化应用。Gartner(美国一家信息技术研究分析公司)数据也表明,截至2025年底,嵌入真正AI Agent的企业应用占比不足5%。
胡延平观察到,大模型和智能体正从对话走向任务执行,从预训练走向持续学习,从数据语料走向持续多维的现实感知。“预测世界杯冠军这类探索项目,会加速这个进化过程。未来行动智能体所需要的能力体系,正在向‘感知—交互—决策—协同’方向演进。”
不过,王岩坦言,世界杯冠军预测可以作为Agent能力的公开压力测试,但不能自动证明Agent能力的实质性提升。大模型在这场“押注”中真正训练和检验的,是长任务组织、概率校准和用户交互能力。
“Kimi的300个Agent代表分析覆盖面的增加,但并不直接等同于预测准确率的提升。相关Agent任务Token消耗研究显示,同一任务的Token消耗可相差几十倍,更多Token并不必然带来更高准确率。”王岩向每经记者进一步分析。
正如王岩所言:“当前Agent的最大缺口,正在从‘能否给出合理计划’转向‘能否稳定完成长周期真实任务’。”这意味着,谁能率先落地“实战能力”,谁就有机会在这场日益激烈的竞赛中脱颖而出。
责任编辑:小编