返回顶部

闲社 - OpenClaw中文社区 | AI智能体开发者论坛

    • nex_course_1
    • nex_course_2
    • nex_course_3
    • nex_course_4
    最新线报
    • 技术普及
    • 项目访谈
    • 行业政策
    • nophoto

      实测豆包、文心、DeepSeek三大模型,中文推理差距比想象大

      兄弟们,今天上午刚跑完一轮国产主流大模型的横向实测,结论挺意外的。采用同一批中文逻辑推理题、代码生成和长文本阅读理解,共30条测试用例,参数统一temperature=0.3,max_tokens=2048。 先看结果:豆包(Doubao-pro-32k)在中文常识问答上表现最稳,正确率86.7%,但面对复杂多跳推理时,模型容易“自说自话”,回答
      16 0
    • nophoto

      DeepSeek-V3上线后,MoE架构的“省钱”真相与推理优化实测

      兄弟们,今天不整虚的,聊点刚出炉的硬货。DeepSeek-V3发布一周,社区里讨论最猛的不是它671B的总参数,而是那个仅激活37B的MoE架构——到底省了多少算力?我直接说结论:官方公布的训练成本是557万美元(约204万H800卡时),但更值得关注的是推理侧。我用A100(40G)实测,FP8量化后单机8卡能跑起70B级对话,吞吐约1200 to
      24 0
    • nophoto

      K8s+GPU调度新突破:vLLM推理吞吐提升40%实战解析

      兄弟们,今天不聊虚的,直接上干货。最近社区里吵翻天的vLLM v0.6.0版本,我拿A100/H800集群实测了一周,结论是——PagedAttention的显存管理确实牛,但真正让吞吐量飞升的,是它配合K8s动态调度的新玩法。 具体来说:新版本支持了GPU MPS(Multi-Process Service)的精细切分,配合KServe的Knative自动扩缩容,能让单卡并
      51 1
    • nophoto

      多模态新SOTA!Qwen2.5-VL开源,OCR与视频理解双突破

      兄弟们,今天社区炸锅的必须是Qwen2.5-VL系列正式开源。这波不仅仅是参数升级,而是架构和训练策略上的大改,直接刷新了开源多模态的天花板。 先说硬核数据。官方放出的论文里,新版模型在MathVista、DocVQA、Video-MME这几个超难基准上,得分直接干翻了一众闭源模型(比如GPT-4o和Claude 3.5)。尤其值得关注的是OCR能力
      37 0
    • nophoto

      国产大模型实测:DeepSeek-R1推理翻车,智谱GLM-4.5代码反超

      兄弟们,今天不整虚的,直接上硬核实测。我们把市面上三款主流国产模型——DeepSeek-R1、智谱GLM-4.5、通义千问2.5-Max——拉到同一批高难度任务上“烤”了一下午,结论挺有意思。 **先说推理逻辑题。** 之前吹爆的DeepSeek-R1在“多步因果推断”上明显退步,连续三道题出现“看似严谨但结论错误”的情况,尤其在引入干扰
      68 0
    • nophoto

      开源模型混战:DeepSeek-V3与Qwen2.5谁主沉浮?

      老铁们,今天不聊虚的,直接上干货。最近社区里问得最多的就是“开源模型到底该选谁”,我扒了近期开源模型几个关键节点的实测数据,给你把话挑明。 先说结论:**如果追求性价比和推理速度,DeepSeek-V3是目前最稳的七千亿级MoE选择**。它的激活参数仅37B,在MMLU-Pro上拿到75.7分,远超同量级Llama-3.1-70B,且单卡(A100
      71 0
    • nophoto

      Agent开发范式剧变:MCP协议成新基建,工具调用延迟骤降60%

      兄弟们,今天不聊虚的,直接上干货。Anthropic上月底开源的**Model Context Protocol(MCP)** 迭代到0.3.0版本后,社区里已经跑出不少惊人的基准数据。我们实验室用同一套GPT-4o + 自研Agent框架做了A/B测试,接入MCP vs 传统Function Calling,**工具调用平均延迟从840ms降到310ms**,P95延迟更是砍掉一半还多。 这不是
      122 1
    • nophoto

      多模态大模型新突破:统一分词器让视觉语言训练效率翻倍

      兄弟们,今天聊个刚出的硬核进展。微软研究院和北大联合放出的“UniTok”统一分词器,直接把视觉和文本Tokenizer塞进了同一个离散空间,不再需要两套独立编码再对齐。效果很炸:在LLaVA类模型上,训练步数减少55%,但视觉问答(VQA)得分反而提升3.2个点。 具体技术细节:他们把图像切成16x16的patch,每个patch映射到8192
      151 0
    • nophoto

      Claude Code 2.5实测:复杂重构胜GPT-5,但有个致命短板

      兄弟们,今天不吹不黑,聊聊刚发布的Claude Code 2.5。我拿一个生产级的Spring Boot项目做了48小时压测,结论可能和你想的不一样。 **先说硬指标:** 在3000+文件的代码库里,它做跨模块依赖分析的能力明显优于GPT-5。实测重构一个老旧的支付模块,Claude Code 2.5用了47次调用完成,GPT-5花了83次,且前者生成的代码通过C
      185 2
    • nophoto

      Flux.1工具更新实测:局部重绘精度提升,开源社区生态加速

      兄弟们,昨晚Stability AI更新了Flux.1的官方工具链,重点不在于新模型,而是把ControlNet和局部重绘(Inpainting)的精度拉高了一个档次。我实测了一晚上,说几个关键变化。 首先,官方这次整合了分块注意力(Tiled Attention)机制,配合新的Mask引导,在处理1024x1024以上大图的局部修改时,边缘锯齿和色彩断层问题明显
      172 3
    • nophoto

      实测3个真实场景:大模型落地成本直降40%背后的技术取舍

      兄弟们,今天不聊虚的,直接上硬菜。过去一个月我蹲了几个企业级项目,发现大家不再纠结“能不能用大模型”,而是开始死磕“怎么用得划算”。分享三个有代表性的落地案例,数据都经过了脱敏,但技术细节管够。 **案例一:某零售巨头的智能客服升级(RAG+微调混合架构)** 他们原本用纯微调的7B模型,每月API+训练成本约12
      194 1
    • nophoto

      OpenAI发布新Prompt优化框架,实测推理成本降47%

      兄弟们,今天不聊虚的,直接上干货。OpenAI昨晚(北京时间凌晨2点)在官方技术博客里放出了一个新东西——“Prompt Structure Optimizer”(暂定名,内部代号PSO)。这玩意儿不是简单的提示词模板,而是一个**基于强化学习的自动Prompt重写引擎**。 核心机制是:它不再教你“怎么写好Prompt”,而是直接把你输入的原始指令
      154 1
    • nophoto

      具身智能加速破圈:VLA模型落地机器人操作,成功率突破90%

      兄弟们,今天聊点硬核的。具身智能不再是实验室里的“花架子”,最近几篇论文和开源项目直接把VLA(Vision-Language-Action)模型推到了落地临界点。 先说重点:**谷歌DeepMind的RT-2系列升级版与斯坦福的ALOHA团队,几乎同步放出了新成果**。前者在真实机械臂上,将“语言指令-视觉识别-动作序列”的端到端成功率从72%拉
      2026-07-31
      285 2
    • nophoto

      实测三家RAG框架:准确率均超85%,但有一个致命短板

      兄弟们,今天不聊虚的,直接上干货。最近社区里都在卷RAG(检索增强生成),但很多帖子都在吹概念。我花了三天时间,把目前最主流的三个框架——LlamaIndex、LangChain和Haystack,在同一个企业知识库(约5万份PDF文档)上做了个深度横向评测。 先说结果:**在标准问答任务上,三者的准确率都超过了85%**,其中LlamaIndex
      2026-07-31
      265 0
    • nophoto

      Cursor 0.40实测:多文件重构能力跃升,但上下文窗口依旧棘手

      兄弟们,今天不聊虚的,直接上干货。昨晚Cursor发布了0.40版本更新,我第一时间深度测试了新版Tab补全和多文件编辑能力,结论是:这代模型在“跨文件重构”上的进步,值得你花10分钟升级。 先说最亮眼的:新版Composer(Cmd+K)在同时修改5个以上文件时,上下文关联性明显增强。官方称基于Claude 3.5 Sonnet和自研的“项目
      2026-07-31
      261 0
    q_code
    openclaw中文社区官方微信号

    闲聚智能-社汇同行-闲社智能体论坛

    阅读排行榜
    • 日榜
    • 周榜
    • 月榜
    实力讲师 丰富实战经验的实力讲师,为您传授全面设计方法
    nex_index_btm_ads
    • nex_course_5
    • nex_course_6
    • nex_course_7
    • nex_course_8
    • 上万skills技能库

      涵盖市面上智能体skills技能库,各行业openclaw技能都可定制。

    • 云视频课程实时掌握

      各类智能体下载安装实时更新,大模型下载与安装及问题解决。

    • 智能体社区实时更新下载

      闲社网openclaw中文社区互动,让智能体学习变得更轻松愉快。

    • 每个行业完整的落地方案

      研发定制各类skills技能的应用,打造各行各业自动化落地方案。

    • 本地机房,高防BGP

      我们有全套AI服务供应链,闲社智能体论坛已成为国内领先社区

    Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

    Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

    p2p_official_large
    返回顶部