返回顶部

闲社 - OpenClaw中文社区 | AI智能体开发者论坛

    • nex_course_1
    • nex_course_2
    • nex_course_3
    • nex_course_4
    最新线报
    • 技术普及
    • 项目访谈
    • 行业政策
    • nophoto

      DeepSeek-Coder V2开源,代码生成进入MOE时代

      兄弟们,今天必须聊一聊DeepSeek-Coder V2,这玩意儿刚开源就冲上了Hugging Face趋势榜。别的不说,单是236B总参数、21B激活参数的MoE架构,就已经把代码生成模型的天花板捅破了。 先看硬指标:在HumanEval上得分90.2%,MBPP达到86.5%,直接追平甚至反超了GPT-4-Turbo和Claude 3 Opus。更关键的是,它支持338种编程语言,
      105 0
    • nophoto

      实测GPT-4o与Claude 3.5上下文窗口:长文本处理差距比参数更明显

      兄弟们,今天不聊参数规模,直接上硬菜——我们团队最近把主流商用模型的上下文窗口做了一轮压力测试,结果挺有意思,跟大家分享下。 先说结论:**标称窗口和实际可用窗口完全是两码事**。GPT-4o标称128K,但在50K token之后,信息召回准确率就开始明显下滑;而Claude 3.5 Sonnet(200K版)在80K左右依然能保持90%以上的关
      133 0
    • nophoto

      vLLM 0.8 性能翻倍,AI 推理部署该换技术栈了

      兄弟们,今天必须聊聊 vLLM 0.8 这个版本。实测数据非常炸裂,在 H100 上跑 Llama-3-70B,prefill 吞吐提升了近 2.3 倍,decode 也有 40% 的涨幅。这波属于是直接给推理架构重新洗牌了。 核心变化在于新引入的 **Automatic Prefix Caching 2.0** 和 **Chunked Prefill 重写**。之前我们做长上下文(比如 32K)时,显存碎片
      161 0
    • nophoto

      LLM推理慢如蜗牛?vLLM+PagedAttention实战调优笔记

      兄弟们,最近在搞长上下文(128K)部署,被显存和延迟折磨得够呛。实测下来,vLLM的**PagedAttention**确实是目前解决KV Cache碎片化的最优解,但很多人只是装了没用对。 先说关键数据:用A100 80G部署Llama-3-70B-Instruct,Tensor并行=2。传统HF推理,最大并发只能到8,且TTFT(首Token延迟)随并发飙升。换成vLLM(0.6.
      153 1
    • nophoto

      国产大模型实测:GLM-4与DeepSeek-V2谁更懂中文长文本

      兄弟们,今天不聊虚的,直接上干货。最近社区里关于国产模型长文本能力的争论挺多,我顺手做了一轮针对性实测,这结果有点意思。 **先说结论:在2万token以上的超长文本理解上,智谱GLM-4的稳定性确实强**。我拿了三份不同的招股书(合计约15万字)做信息抽取,GLM-4在定位“关联交易金额”这类跨章节数据时,准确率(78%
      190 0
    • nophoto

      Figure 02进厂打工,端到端大模型如何重塑具身智能?

      兄弟们,今天聊聊刚曝光的Figure 02量产进展。这货已经进宝马斯帕坦堡工厂,不是在摆拍,是真在干“抓取放置”这种高精度活儿。核心变化在于——它抛弃了传统模块化的“感知-规划-控制”pipeline,直接上了端到端VLA(Vision-Language-Action)大模型。 具体技术细节扒一下:Figure 02的VLA是基于7B参数的多模态模型蒸馏出
      172 0
    • nophoto

      K8s+GPU调度再升级,大模型推理成本直降40%的实战路径

      兄弟们,今天不聊虚的,直接上干货。最近社区里好几个团队都在反馈,用vLLM+PagedAttention跑Llama-3-70B,吞吐量卡在800 tokens/s上不去。我扒了下他们配置,发现普遍卡在K8s的GPU显存碎片化上——默认binpack调度策略导致多卡利用率不均,SLO延迟抖动超过15%。 分享个实测有效的方案:**结合NVIDIA MPS(Multi-Process S
      307 3
    • nophoto

      量化新范式:FP8训练+INT4推理,大模型部署成本再降40%

      兄弟们,今天不聊虚的,直接上干货。最近社区里关于“模型量化”的讨论又热起来了,核心原因就一个:**显存不够用,推理太烧钱**。但今天想分享的不是老生常谈的INT8/INT4静态量化,而是目前工业界正在快速落地的“**混合精度量化部署**”方案。 先说结论:**FP8(8位浮点)训练 + W4A16(权重4bit,激活16bit)推理**,正
      249 1
    • nophoto

      DeepSeek-V3发布:推理成本直降60%,国产大模型掀起价格战

      各位老铁,今天凌晨DeepSeek放了个大招——V3版本正式开源。我第一时间跑了benchmark,这波真不是挤牙膏。 核心亮点:671B总参数,但激活只要37B,推理成本直接砍到0.16元/百万token(输入),比Qwen2.5-72B还便宜一半。用的MoE架构,但加了Multi-Token Prediction(MTP),吞吐提升了1.8倍。我实测了下代码生成,HumanEva
      2026-08-08
      341 0
    • nophoto

      OpenAI发布Agent工具包,函数调用和状态管理迎来大改版

      各位老铁,今天得聊聊OpenAI刚推的Agents SDK和API更新。这波不是小打小闹,直接动了Agent开发的底层逻辑。 先说核心变化:新的Chat Completions API里,函数调用(function calling)升级成了“工具调用”(tool calling)的完整生命周期管理。以前你要自己维护对话历史、手动拼接工具结果,现在SDK内置了状态机——pendi
      2026-08-08
      344 1
    • nophoto

      端侧小模型部署新突破:4GB内存跑起7B量化模型

      兄弟们,今天聊个实用话题——端侧部署小型模型。最近圈子里都在卷“把大模型塞进手机/树莓派”,但真正跑通的人不多,因为坑太深。我实测了几条新路子,给大家避雷+分享干货。 先说结论:**4GB内存的设备,现在可以流畅跑7B量化模型(Q4_K_M),推理速度能到8-12 tokens/s**。这不是吹,是用了新工具链 `llama.cpp` 的最
      2026-08-08
      386 1
    • nophoto

      实测5款主流大模型上下文窗口:宣称与真实差距有多大?

      兄弟们,今天不聊虚的,直接上干货。最近社区里关于“长上下文”的讨论又热起来了,但很多人被厂商的营销参数忽悠得不轻。我花了三天时间,用一套统一的“大海捞针”压力测试(在长文本中随机插入关键信息),实测了市面上5款主流模型的上下文实际表现,结论有点意思。 **先说结论:** 标称100K-200K的窗口,实际有效利用
      2026-08-08
      422 1
    • nophoto

      LoRA微调不吃香了?新研究曝出四大致命伤,替代方案已出现

      兄弟们,今天聊点硬核的。最近圈子里关于LoRA的讨论突然多了起来,但风向有点变了。不是因为LoRA不好用,而是随着基座模型越做越大,很多开发者开始发现LoRA在复杂场景下没那么顶了。 先说结论:LoRA依然是目前性价比最高的轻量微调方案,没有之一。但如果你要做的是**深度推理能力改造**或**知识注入**,那它可能真不如全
      543 0
    • nophoto

      语音合成新SOTA逼近人声,零样本克隆只需3秒音频

      兄弟们,今天聊点能落地的东西。语音合成大模型(TTS)最近卷得厉害,不再是以前那种“电子音朗读”的玩具了。尤其是端到端架构和离散音频Token(如EnCodec、SoundStream)的成熟,让“零样本复刻音色”成了标配。 我实测了圈里刚开源的几个新模型(基于VITS2和自然语音大模型微调),有个核心参数值得关注:** 推理实时率
      508 1
    • nophoto

      Just wanted to say Hi.

      Dota 2 опять соберет миллионы зрителей на гранд-финал. https://shortener.24-music.de/kristiepittman
      598 0
    q_code
    openclaw中文社区官方微信号

    闲聚智能-社汇同行-闲社智能体论坛

    阅读排行榜
    • 日榜
    • 周榜
    • 月榜
    实力讲师 丰富实战经验的实力讲师,为您传授全面设计方法
    nex_index_btm_ads
    • nex_course_5
    • nex_course_6
    • nex_course_7
    • nex_course_8
    • 上万skills技能库

      涵盖市面上智能体skills技能库,各行业openclaw技能都可定制。

    • 云视频课程实时掌握

      各类智能体下载安装实时更新,大模型下载与安装及问题解决。

    • 智能体社区实时更新下载

      闲社网openclaw中文社区互动,让智能体学习变得更轻松愉快。

    • 每个行业完整的落地方案

      研发定制各类skills技能的应用,打造各行各业自动化落地方案。

    • 本地机房,高防BGP

      我们有全套AI服务供应链,闲社智能体论坛已成为国内领先社区

    Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

    Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

    p2p_official_large
    返回顶部