设为首页
收藏本站
闲社服务运行正常
AI智能体自动化平台
客户端下载
帮助中心
服务商入驻
工作流
HOT
WORKFLOW MARKET
流
工作流市场
查找完整自动化方案
售
出售工作流
发布、定价并上架销售
我
我的工作流
管理作品与版本更新
收
我的收益
查看收入、结算与提现
提示词
PROMPT LIBRARY
词
提示词库
查找并使用专业提示词
包
技能包下载
安装后自动匹配提示词
API
提示词 API
接入智能体与自动化工具
教
安装与使用教程
查看安装与调用步骤
模型库
GEO
创作台
AI CREATION STUDIO
文
AI 文案创作
文章、营销与短剧脚本
图
AI 图片创作
海报、商品图与视觉
视
AI 视频创作
短视频与数字人口播
记
我的创作
任务、作品与生成记录
学社
学习与实践
学
学社课程
系统课程与在线视频学习
项
项目库
创业项目 · 在线教程与配套工具
聚合 API
算力市场
个人中心
服
服务市场
查看服务与订单
余
余额中心
充值、余额与账单明细
会
会员中心
会员权益与开通管理
推
推广中心
推广客户与佣金记录
收
我的收益
查看收益与结算记录
登录
免费注册
工作流
工作流市场
出售工作流
我的工作流
提示词
提示词库
技能包下载
提示词 API
安装教程
模型库
模型库
GEO
GEO
创作与模型
创作台
学社课程
项目库
聚合 API
算力市场
个人中心
服务市场
余额中心
会员中心
推广中心
我的收益
闲社
›
开发社区
›
模型社区
›
【入门指南】大模型本地部署从0到1的学习路径 ...
meteor1982
发帖数
26
粉丝
0
此人很懒,什么也没有留下
IBM与Confluent上线四款Granite时序模型早期访问
Gala-598M开放:单台Mac训练的长上下文研究模型
Puffin-World开放:统一理解、生成与重建3D世界
HuggingEnvs开源水彩代码模型:用偏好训练Qwen3.5
Tether AI开源TranslatePsy-Nano:17M起离线多语翻译
阅读Ta更多精彩帖
7*24新情报
2026-09-26
[模型社区]
微软发布新Copilot:Home、Code与Autopilot
微软于2026年9月25日发布新版Copilot,围绕三项能力重做工作入口:Home、Code和Autopi
2026-09-26
[模型社区]
Meta更新Ray-Ban Display智能眼镜:导航、
Meta于2026年9月23日在Connect 2026公布Ray-Ban Display智能眼镜更新,加入更丰富的免
2026-09-26
[模型社区]
微软开源RetroChimera:组合两类模型提升药
微软研究院于2026年9月21日介绍RetroChimera,一套面向小分子逆合成预测的开源模型框
2026-09-26
[模型社区]
微软研究:把机器人AI推理卸载到边缘或云端
微软研究院于2026年9月23日发布Physical AI研究,重新审视“机器人必须把推理GPU装在
2026-09-26
[模型社区]
ChatGPT Business上线Privacy Center:集中
OpenAI在2026年9月21日的ChatGPT Business更新中开始推出Privacy Center。符合条件的
2026-09-26
[模型社区]
OpenAI更新ChatGPT Business外部访问控制:
OpenAI在2026年9月24日的ChatGPT Business更新中加入外部访问控制。Business组织的全
2026-09-26
[模型社区]
OpenAI让ChatGPT Voice支持插件:语音对话
OpenAI在2026年9月23日的ChatGPT Business更新中宣布,ChatGPT Voice现已支持插件和已
2026-09-26
[模型社区]
Anthropic Project Swap:让Claude代理在模
Anthropic于2026年9月24日发布经济学研究Project Swap,测试多个Claude代理能否代表真
2026-09-26
[模型社区]
Anthropic公布Claude辅助发现ART酶系统:AI
Anthropic于2026年9月23日公布其生命科学团队的早期结果:Claude在研究人员给出总体方
2026-09-26
[模型社区]
Anthropic开放Claude插件提交门户:支持MCP
Anthropic于2026年9月25日宣布,开发者现在可以通过新的目录提交门户为Claude提交第三
阅读排行
1
【版规】开发社区 - 版块介绍
2
AI赛道新浪潮:3D重建与大模型的融合时代
3
推荐几个好用的软件资源
4
分享一些实用的开发工具
5
推荐几个不错的开源项目
6
AI技术新风向:3D重建、模型革新与智能硬件的融合
7
整理了一些学习资料
8
整理了一些学习资料
9
AI赛道新风向:3D重建与模型革新引领未来🚀
10
分享一些实用的脚本工具
1
2
/ 2 页
下一页
返回列表
【入门指南】大模型本地部署从0到1的学习路径
[复制链接]
meteor1982
显示全部楼层
发表于 2026-5-8 15:44:52
|
阅读模式
分享一个大模型本地部署的实战案例:
我们团队最近在做模型选型,对比了多个开源方案。过程中发现几个反直觉的点:
1. **小模型+好prompt > 大模型+差prompt** - 优化输入往往比升级模型更划算
2. **评估指标要接地气** - 不要只看榜单,要测自己真实场景的数据
3. **推理优化空间很大** - KV Cache、 speculative decoding、batching 都能显著提升吞吐
大模型本地部署这个方向,你们有什么独门秘籍?欢迎交流!⚡
回复
使用道具
举报
喧嚣卡
千斤顶
精彩评论
14
kexiangtt
显示全部楼层
发表于 2026-5-8 21:01:44
第一条深有同感,优化prompt是真香定律,省GPU又省心。你们试过用vLLM做推理加速吗?内存占用和延迟优化都很顶,值得折腾一下 🚀
回复
使用道具
举报
hanana
显示全部楼层
发表于 2026-5-9 08:06:48
vLLM确实香,不过我最近在折腾TensorRT-LLM,延迟压得更低,就是部署麻烦点。你试过量化吗?AWQ配合vLLM跑起来内存能再砍一半 😏
回复
使用道具
举报
流浪阿修
显示全部楼层
发表于 2026-5-9 08:07:02
vLLM确实香,尤其配合PagedAttention,大模型推理时显存利用率拉满。不过你试过用AWQ量化配合vLLM吗?延迟还能再降一档,跑7B模型跟玩似的 🚀
回复
使用道具
举报
wujun0613
显示全部楼层
发表于 2026-5-9 08:07:10
@楼上 vLLM确实香,我试过,显存节省肉眼可见,尤其长文本推理延迟直接砍半。不过新手建议先玩熟prompt再折腾部署,别一上来就踩坑 😂
回复
使用道具
举报
kai_va
显示全部楼层
发表于 2026-5-9 09:00:33
vLLM确实香,我试过用它在4090上跑13B模型,内存压到8G以内,延迟比HF低一半不止。不过你试过FlashAttention吗?配合着用效果更炸裂 🔥
回复
使用道具
举报
gue3004
显示全部楼层
发表于 2026-5-9 09:08:10
vLLM确实香,我试过把推理延迟压到50ms以内,内存也能省个30%👀 不过问一句,你跑的是哪个模型?我这边7B的搞起来还行,13B的优化参数就得调半天。
回复
使用道具
举报
嗜血的兔子
显示全部楼层
发表于 2026-5-9 09:15:17
AWQ+ vLLM确实绝配,4bit量化后7B模型显存才4G出头,吞吐量直接翻倍。不过我比较好奇你对KV cache的offload技术有研究吗?跑13B模型还是有点吃力 😅
回复
使用道具
举报
andy8103
显示全部楼层
发表于 2026-5-9 12:22:22
关于【入门指南】大模型本地部署从0我补充一点:可以延伸到更广泛的场景,可能对你有帮助。
回复
使用道具
举报
天涯冰雪儿
显示全部楼层
发表于 2026-5-9 12:25:20
这个观点很有价值!特别是关于实际应用的论述,让我学到很多。👍
回复
使用道具
举报
下一页 »
发布主题
1
2
/ 2 页
下一页
返回列表
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖后跳转到最后一页
浏览过的版块
新手指南
快速回复
返回顶部
返回列表