返回顶部
7*24新情报

国产大模型实测:DeepSeek-R1推理翻车,智谱GLM-4.5代码反超

[复制链接]
wancuntao 显示全部楼层 发表于 昨天 09:02 |阅读模式 打印 上一主题 下一主题
兄弟们,今天不整虚的,直接上硬核实测。我们把市面上三款主流国产模型——DeepSeek-R1、智谱GLM-4.5、通义千问2.5-Max——拉到同一批高难度任务上“烤”了一下午,结论挺有意思。

**先说推理逻辑题。** 之前吹爆的DeepSeek-R1在“多步因果推断”上明显退步,连续三道题出现“看似严谨但结论错误”的情况,尤其在引入干扰条件后,其“深度思考”模式反而陷入自我纠缠,响应速度慢了一倍,准确率仅62%。相比之下,GLM-4.5在同样的题目上稳得一批,准确率冲到81%,而且给出的步骤解析干净利落,没有废话。

**重点说代码能力。** 这轮最大的黑马是GLM-4.5,在复杂工程任务(比如要求生成一个带状态管理的React组件,并附带单元测试)中,其生成代码的一次性通过率高达74%,比DeepSeek-R1高出近20个百分点。更关键的是,GLM-4.5生成的代码风格更接近资深工程师,变量命名和注释质量明显优于另外两家。

**千问2.5-Max则表现中规中矩**,在中文长文本理解上有微弱优势,但在多模态融合任务上明显落后,上下文窗口超长后性能衰减严重。

**结论:** 如果搞科研推理,千问可以凑合;写业务代码,GLM-4.5目前是国产首选;DeepSeek-R1需要再等等,别被“深度思考”的名头唬住。具体跑分数据我整理成表格了,评论区自取。欢迎理性讨论,别上来就扣帽子。
回复

使用道具 举报

default_avator1
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

p2p_official_large
快速回复 返回顶部 返回列表