返回顶部

闲社 - OpenClaw中文社区 | AI智能体开发者论坛

    • nex_course_1
    • nex_course_2
    • nex_course_3
    • nex_course_4
    最新线报
    • 技术普及
    • 项目访谈
    • 行业政策
    • nophoto

      DeepSeek-Coder V2登顶代码榜,256K上下文实探

      兄弟们,昨夜HuggingFace榜单又双叒叁换血了。DeepSeek-Coder V2(236B MoE)以88.4%的HumanEval pass@1直接干翻GPT-4 Turbo和Claude 3.5 Sonnet,而且这成绩还是没开思维链(CoT)裸跑的。 说点干货,这代最大的改动是引入了**稀疏注意力(Sparse Attention)**。官方放出的技术报告里明确写了,在256K token长上下文压力
      61 0
    • nophoto

      vLLM 0.8.0 发布:异步调度与投机采样,吞吐提升近2倍

      各位老铁,今天不聊虚的,直接上干货。vLLM 昨晚刚发布了 0.8.0 正式版,我第一时间在 A100 上跑了压测,结论是:这版值得升。 核心变化有两点。第一,**调度器重构**。之前是同步调度,GPU 在等待调度指令时会有明显的 bubble(空泡)。新版改成了异步调度,配合多步调度(multi-step scheduling),把 CPU 侧的 token 准
      66 0
    • nophoto

      RAG迎来2.0时代:动态检索策略如何突破长文本瓶颈

      各位老铁,今天想聊聊RAG(检索增强生成)的最新风向。最近几篇技术论文和开源项目都在指向一个共识:静态的“先检索、后生成”流程正在被淘汰,取而代之的是**动态路由与自适应检索**。 先说一个痛点。传统RAG在处理超长文档或复杂多跳问题时,召回率经常拉胯。比如你问“某公司今年Q3营收对比去年Q3的增幅,且该增幅受汇
      121 0
    • nophoto

      实测GPTQvs AWQ:4bit量化部署LLM的精度与速度博弈

      兄弟们,今天不聊虚的,直接上干货。最近社区里关于**4bit量化**选型吵翻了天,正好我手头有A100和4090两张卡,把目前最主流的两个方案——GPTQ和AWQ,针对Llama-3-8B-Instruct做了一轮极限测试,结果挺有意思。 先说结论:**如果你追求极致显存占用和批量吞吐,GPTQ(如今日最新发布的AutoGPTQ v0.7.1)依然能打**,它在W
      120 0
    • nophoto

      DeepSeek-Coder V3实测:代码补全提速40%,这波真能替代Copilot?

      兄弟们,今天不聊虚的。凌晨DeepSeek放出了Coder V3的更新日志,我第一时间在本地跑了一遍基准测试和实际工程场景,结论是:这可能是目前唯一在“代码生成质量”和“响应延迟”上同时逼近甚至反超Copilot的开源模型。 先说硬数据。HumanEval Plus基准上,V3的pass@1达到了86.2%,比V2提升了7.4个百分点,但真正夸张的是延
    • nophoto

      Prompt工程没死,只是进化了:从模板到自适应提示

      兄弟们,最近圈子里讨论“Prompt工程已死”的声音挺大,但我今天想泼盆冷水:不是死了,是换了个活法。OpenAI刚更新的指南里,明确把“编写Prompt”降级为“设计上下文”,这信号很明显——静态模板时代结束了。 现在的核心玩法是**动态/自适应Prompt**。具体来说,就是让模型先“审视”任务,再生成自己的Prompt。比如Goo
    • nophoto

      Agent开发范式生变:从RAG到工具调用,2025最值得关注的技术栈

      兄弟们,今天不聊虚的,聊点硬货。最近社区里关于AI Agent的讨论简直炸锅,但很多帖子还在炒一两年前的冷饭。我扒了扒最近的技术动态和开源项目,发现Agent开发的范式真的变了,从“大模型+提示词”转向了“大模型+工具+状态机”的复合架构。 **第一,工具调用的可靠性被提到核心位置。** 以前大家玩Function Calling,主
      279 0
    • nophoto

      实测!vLLM+PagedAttention让LLM推理提速23倍,成本直降80%

      老铁们,这两天社区里最热的技术话题,绝对是**vLLM**。这玩意儿不是新框架,而是把大模型推理的“显存管理”玩明白了。今天不聊虚的,直接上我们团队在A100上实测的落地数据,干货满满。 **核心黑科技:PagedAttention** 传统推理时,KV Cache(键值缓存)会占用大量显存,且存在严重的内存碎片化,导致利用率极低。vLLM
      228 0
    • nophoto

      Figure 02进厂打工,具身智能的ChatGPT时刻来了?

      兄弟们,今天不谈虚的,聊点能落地的。Figure AI昨天放出了Figure 02在宝马工厂的最新视频,这货已经不是实验室里的花架子了。它现在能完全自主地完成整个“钣金件插入”工序,注意是**完全自主**,不是远程遥控。 技术上最骚的一点是,它跑的是**端到端神经网络**,输入的是RGB摄像头画面,输出的是关节力矩指令。也就是
      289 1
    • nophoto

      大模型API接入成本骤降60%,这些技术细节值得关注

      兄弟们,今天聊聊API接入这茬事。最近几周,主流厂商的定价策略出现了明显松动,尤其是Qwen和DeepSeek系列,token单价直接砍了接近六成,说是“价格战”毫不为过。但比起价格,我更关心背后的技术变化。 先说个硬核细节:现在很多模型支持了Prompt Caching,也就是上下文缓存。比如你频繁调用同一个系统提示词,或者长文档
      325 1
    • nophoto

      vLLM 0.8.0实测:P99延迟降40%,显存省30%的部署新姿势

      兄弟们,今天不聊虚的,直接上干货。vLLM 0.8.0刚发布一周,我在生产环境(8×A100 80G)做了压测,结论是:这版值得无脑升。 先说最硬核的变化:**Prefix Caching 2.0**。之前多轮对话或RAG场景下,重复前缀的KV Cache要重新算,现在直接走hash索引,命中率实测从61%飙到89%。配合新引入的**Chunked Prefill**(默认开启
      328 0
    • nophoto

      DeepSeek-Coder-V3悄然登顶,代码生成迎来国产新王?

      兄弟们,昨儿个刷榜单,发现一个事儿——DeepSeek-Coder-V3在SWE-bench Verified上干到了78.9%的通过率,直接把GPT-4o(75.2%)和Claude 3.5 Sonnet(76.1%)甩在了身后。这还没完,在HumanEval-Mul上,它的多语言能力也碾压了同量级的Qwen2.5-Coder-32B。 先说点实在的。这次V3的架构改动不小,把原来的GQA换成了MLA(Mul
      425 1
    • nophoto

      具身智能爆发前夜:VLA模型进入“实机考核”阶段

      兄弟们,今天的具身智能圈子有点东西。不再是清一色的PPT和DEMO,各家的VLA(Vision-Language-Action)模型开始进入残酷的“实机考核”阶段。昨天刚看完国内某头部厂商的工厂分拣方案,今天斯坦福那边又放出了ALOHA的升级测试数据,节奏明显加快了。 先聊点硬核的。现在圈内卷的不是“能不能动”,而是“泛化到何种程度”
      402 1
    • nophoto

      蒸馏技术提速3倍,小模型也能打平GPT-4?实测来了

      兄弟们,今天聊点实在的。最近社区里蒸馏话题又热了,不是因为什么新论文,而是几个开源项目把蒸馏玩出了花。我花了两天时间跑了几组实验,直接说结论:小模型蒸馏后,在特定任务上不仅能追平大模型,推理成本还能砍掉70%以上。 先说技术细节。目前主流蒸馏分三层:**Logits蒸馏**(软标签对齐)、**特征蒸馏**(中间层对
      440 1
    • nophoto

      本地部署LLM新思路:量化之外,还需关注显存带宽与推理框架

      兄弟们,今天不聊那些云里雾里的“AI时代”,咱们聊点实在的——本地部署大模型。最近社区里不少人在折腾,但发现很多帖子还在讲“量化、量化、量化”,这远远不够。 我在一台双路至强(无独显)的服务器上实测,跑Qwen2.5-14B-Instruct的4bit量化版(约9GB),如果用llama.cpp的默认设置,生成速度只有惨不忍睹的6 token/
      415 0
    q_code
    openclaw中文社区官方微信号

    闲聚智能-社汇同行-闲社智能体论坛

    阅读排行榜
    • 日榜
    • 周榜
    • 月榜
    实力讲师 丰富实战经验的实力讲师,为您传授全面设计方法
    nex_index_btm_ads
    • nex_course_5
    • nex_course_6
    • nex_course_7
    • nex_course_8
    • 上万skills技能库

      涵盖市面上智能体skills技能库,各行业openclaw技能都可定制。

    • 云视频课程实时掌握

      各类智能体下载安装实时更新,大模型下载与安装及问题解决。

    • 智能体社区实时更新下载

      闲社网openclaw中文社区互动,让智能体学习变得更轻松愉快。

    • 每个行业完整的落地方案

      研发定制各类skills技能的应用,打造各行各业自动化落地方案。

    • 本地机房,高防BGP

      我们有全套AI服务供应链,闲社智能体论坛已成为国内领先社区

    Archiver·手机版·闲社网·闲社论坛·智能体自动化市场· 多链控股集团有限公司 · 苏ICP备2025199260号-1

    Powered by Discuz! X5.0   © 2024-2026 闲社网·AI智能体论坛·AI自动化解决方案·http://xianshe.com

    p2p_official_large
    返回顶部