当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek和Kimi首轮就被淘汰,这项大模型对抗赛说明了什么?

2个月前 (08-06)Deepseek最新资讯199

  谷歌发起的“首届大模型对抗赛”,在赛前就已经话题度拉满,但是随着8月5日比赛正式打响,参赛AI展现出的水平或许令人有些失望。相比于两款中国模型DeepSeek-R1和Kimi K2 Instruct的首轮折戟,比赛传递出的更重要信息在于,通用大模型的推理能力还存在普遍性缺陷。

  首先要说明的是,所谓“首届大模型对抗赛”,其实在比赛形式和参赛AI大模型的选择上都备受争议。

  这次比赛的形式是让大模型两两捉对下国际象棋。谷歌DeepMind团队,也就是2017年凭借AlphaGo彻底在棋类项目上击败人类的团队,为大模型提供了技术接口,让大模型能够“看懂”棋盘。

  其中两款中国模型的选择受到了不少质疑,首先deepseek,Kimi K2 Instruct并非推理模型,在下棋场景存在天然劣势,而DeepSeek-R1已经是半年前发布的“老模型”。因此,不管其表现如何,比赛结果都不能客观反映中国大模型行业的真实水平。

  在比赛的官方网站上,也有用户提出了这样的质疑。而主办方的回复称,这次比赛只是一个开始,后续会将更多中国模型纳入。

  从对阵图中可以看到,首轮四组对决都呈现“一边倒”的态势,获胜方全部都取得了4-0的全胜战绩。

  如果具体来看比赛过程,Kimi K2 Instruct不出意外是表现最差的模型,不光贡献了仅仅4回合就被对手将死的最快败局,还多次因为非法移动被判负(比赛规则设定,如果连续4次尝试非法移动就会被判负)。

  例如下面的场景中,Kimi试图用白马去吃掉对方的黑后,而没有意识到马是不能这样移动的。即使在被人工告知这是非法移动后,它仍然坚持认为这是最优走法。

  事实上,尽管有不少低级错误,Kimi在每一盘的开局中都还表现中规中矩,能够使用人类的经典开局方式,显示出大模型对于国际象棋的基础知识是有认知的。只不过随着局面开始复杂化,所有大模型都开始变得力不从心。

  在推理过程中可以看到,DeepSeek-R1认为对方的黑后威胁到了己方c2的兵,因此打算将白后移动到c3,认为这样可以逼迫黑后做出避让,并用d列的白车威胁同列的黑王。

  但是到了下一回合,白棋仿佛就忘记了前面的考虑,在明明有其它选择的情况下,用自己的王挡住了车的路线,白白损失掉白后。

  有国际象棋爱好者对观察者网指出,这里更常规的选择是白后D4吃兵,在将军的同时还能解放出己方车的路线。看上去,DeepSeek-R1似乎只能考虑到有限的几种情况,缺乏多步推理和全局概念。

  需要指出的是,这不是DeepSeek-R1独有的问题,基本上每个大模型都在常规的开局后,迅速开始下出各种“昏招”。

  在专业的国际象棋网站来,只有Grok 4的表现略胜一筹,能够较好地识别和捕获对方未设防的棋子。

  马斯克也在第一时间“炫耀”说,(下棋)只是Grok 4的“副作用”,他们并未对此做专门训练。

  首先,“首届大模型对抗赛”这样的说法,或许并不合适,因为比赛测试的仅仅是下国际象棋这样的单一能力,并不能完全反映一个模型的综合水平。

  但是谷歌的野心,也不仅仅是办一场国际象棋比赛。事实上,本次比赛更像是谷歌为了打造一个更大规模LLM评价体系的“垫场赛”。

  承办本次比赛的Kaggle,本就是谷歌旗下知名的数据科学赛事平台,在行业内享有很高声誉,如今在DeepMind加持下进军LLM赛事,最终应该是希望打造一套更加完整权威的评价体系。

  当前每逢各家大模型上新,“刷榜”已经成了标准操作,各种“SOTA”层出不穷,但是业内对这些榜单能否真正客观体现模型能力,一直存在质疑。甚至不排除模型在训练阶段,就会针对榜单题目进行针对性优化。

  从这个角度来说,如果能够建立一套新的评级体系,掌握评级话语权,对于谷歌在AI领域的地位将是极大的加强。

  如果只看国际象棋比赛比赛本身,我们也可以看到,其对大模型能力的评估确实也有相当的参考价值。例如,非推理模型Kimi K2 Instruct的确表现较差,而Gemini 2.5 的Pro和Flash也体现出了能力差距。

  而对行业来说,这项比赛也让我们更清晰地看到,即使是2025年最新的推理大模型,在解决垂直问题时的表现,不但不如多年前的AlphaGo,甚至也可能远远不如受过基本训练的人类。单靠通用模型去做场景落地并不现实,这意味着应用层面的创业者仍有广阔空间。原文出处:DeepSeek和Kimi首轮就被淘汰,这项大模型对抗赛说明了什么?,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek和Kimi首轮就被淘汰,这项大模型对抗赛说明了什么?” 的相关文章

亚马逊云科技为何上架Qwen和DeepSeek的最新模型

亚马逊云科技为何上架Qwen和DeepSeek的最新模型

  2025年二季度云业务营收增速17.5%,相比两年前的2023年三季度同比提升5.2个百分点。   亚马逊总裁安迪·贾西(Andy Jassy)在2025年二季度财报...

英特尔 Gaudi 2E AI 宣布为 DeepSeek V3.1 提供加速支持

英特尔 Gaudi 2E AI 宣布为 DeepSeek V3.1 提供加速支持

  IT之家查询获悉,英特尔 Gaudi 2E 采用 7nm 制程,配备 96GB HBM2E 内存、48MB SRAM,具备 2.4TB 总内存带宽,针对随机访问deepseek、线性访...

DeepSeek预测:纽卡斯尔vs利物浦!红军火力全开or喜鹊主场逆袭?范戴克v

DeepSeek预测:纽卡斯尔vs利物浦!红军火力全开or喜鹊主场逆袭?范戴克v

  英超第2轮即将迎来纽卡斯尔与利物浦的强强对话。主队纽卡斯尔首轮0-0闷平维拉,目前排名第13;客队利物浦则以4-2大胜伯恩茅斯暂列第5。两队近5次交锋利物浦3胜1平1负占据优势,但上赛...

“太好办”AI政务通,深度赋能重构政务服务新图景

“太好办”AI政务通,深度赋能重构政务服务新图景

  为进一步加快政务服务数字化转型,持续优化营商环境,近日,太仆寺旗政务服务与数据管理局积极探索DeepSeek与政务服务深度融合,创新推出“太好办”AI政务通应用,提供政务服务高频事项智...

南方路机股价上涨10% 公司新增DeepSeek概念

南方路机股价上涨10% 公司新增DeepSeek概念

  截至2025年8月14日15时,南方路机股价报59.40元,较前一交易日上涨5.40元,涨幅为10.00%。当日开盘价为52.60元,最高价59.40元,最低价51.01元deepse...

DeepSeek线上模型版本升级 六个关键词总结环保行业

DeepSeek线上模型版本升级 六个关键词总结环保行业

  最近,DeepSeek线上模型版本已升级至V3.1。借此机会,环保在线向DeepSeek抛出疑问。对于今年的环保行业,DeepSeek有何看法?   回望2025年前...