设为首页
收藏本站
闲社服务运行正常
AI智能体自动化平台
客户端下载
帮助中心
服务商入驻
工作流
HOT
WORKFLOW MARKET
流
工作流市场
查找完整自动化方案
售
出售工作流
发布、定价并上架销售
我
我的工作流
管理作品与版本更新
收
我的收益
查看收入、结算与提现
提示词
PROMPT LIBRARY
词
提示词库
查找并使用专业提示词
包
技能包下载
安装后自动匹配提示词
API
提示词 API
接入智能体与自动化工具
教
安装与使用教程
查看安装与调用步骤
模型库
GEO
创作台
AI CREATION STUDIO
文
AI 文案创作
文章、营销与短剧脚本
图
AI 图片创作
海报、商品图与视觉
视
AI 视频创作
短视频与数字人口播
记
我的创作
任务、作品与生成记录
学社
学习与实践
学
学社课程
系统课程与在线视频学习
项
项目库
创业项目 · 在线教程与配套工具
聚合 API
算力市场
个人中心
服
服务市场
查看服务与订单
余
余额中心
充值、余额与账单明细
会
会员中心
会员权益与开通管理
推
推广中心
推广客户与佣金记录
收
我的收益
查看收益与结算记录
登录
免费注册
工作流
工作流市场
出售工作流
我的工作流
提示词
提示词库
技能包下载
提示词 API
安装教程
模型库
模型库
GEO
GEO
创作与模型
创作台
学社课程
项目库
聚合 API
算力市场
个人中心
服务市场
余额中心
会员中心
推广中心
我的收益
闲社
›
开发社区
›
模型社区
›
【对比评测】AI基础设施搭建横向对比与选型建议 ...
hightwise
发帖数
46
粉丝
0
此人很懒,什么也没有留下
IBM发布Granite Speech 5.0 TurboCTC:470M英语ASR双版本 ...
模型安全不是玄学:对齐问题不解决,部署就是裸奔 🔥 ...
模型选型避坑指北:不是跑得快就叫好用 🚂
模型推理加速?这3个压箱底技巧别告诉外人 🤫 ...
多模型协作实战:让LLM+小模型搭伙干活,效率翻倍 🚀 ...
阅读Ta更多精彩帖
7*24新情报
2026-09-27
[模型社区]
GitHub Copilot推出可视化Canvas:用自然语
【事件概述】GitHub于2026年9月25日介绍Copilot应用中的Canvas扩展,用户只需用自然语
2026-09-27
[模型社区]
GitHub Copilot接入Slack与Teams:对话可直
【事件概述】GitHub于2026年9月25日发布更新,改进Copilot在Slack和Microsoft Teams中
2026-09-27
[模型社区]
ChatGPT财务功能新增信用分数:可连接Exper
【事件概述】OpenAI在2026年9月21日的ChatGPT更新说明中,为Finances财务功能加入信用
2026-09-27
[模型社区]
微软拟在中东投入超100亿美元扩建云与AI基
【事件概述】微软于2026年9月23日公布面向科威特、卡塔尔、沙特阿拉伯和阿联酋的新框
2026-09-27
[模型社区]
微软全球AI扩散报告:工作年龄人口使用率升
【事件概述】微软AI经济研究院于2026年9月21日发布第二季度《全球AI扩散报告》,用匿
2026-09-27
[模型社区]
微软披露EvilTokens:AI被用于自动分析邮箱
【事件概述】微软数字犯罪部门于2026年9月22日披露并协同打击EvilTokens,这是一个把A
2026-09-27
[模型社区]
ChatGPT上线互动闪卡:上传笔记即可生成复
【事件概述】OpenAI在2026年9月22日的ChatGPT更新说明中上线互动闪卡(Flashcards),
2026-09-27
[模型社区]
ChatGPT新增安全历史:可回看登录与多因素
【事件概述】OpenAI在2026年9月25日的ChatGPT更新说明中加入“安全历史”(Security h
2026-09-27
[模型社区]
Meta将Muse个人智能体带到AI眼镜:支持连接
【事件概述】Meta在2026年9月24日发布Connect 2026总结,宣布把Muse个人智能体带到AI
2026-09-27
[模型社区]
Google Arts & Culture推出AI互动博物馆:G
【事件概述】Google Arts & Culture Lab于2026年9月24日公布两项互动体验,把生成式AI
阅读排行
1
【版规】开发社区 - 版块介绍
2
AI赛道新浪潮:3D重建与大模型的融合时代
3
推荐几个好用的软件资源
4
分享一些实用的开发工具
5
推荐几个不错的开源项目
6
AI技术新风向:3D重建、模型革新与智能硬件的融合
7
整理了一些学习资料
8
整理了一些学习资料
9
AI赛道新风向:3D重建与模型革新引领未来🚀
10
分享一些实用的脚本工具
返回列表
【对比评测】AI基础设施搭建横向对比与选型建议
[复制链接]
hightwise
显示全部楼层
发表于 2026-5-9 12:19:15
|
阅读模式
最近在实践AI基础设施搭建,总结了几点心得分享给大家:
1. **硬件选择很重要** - 不同规模的模型对显存要求差距很大,需要提前评估
2. **推理框架差异** - llama.cpp、vLLM、Ollama 各有场景,不能一概而论
3. **量化是本地跑大模型的关键** - 4bit/8bit 量化性能损失可接受,资源占用降一半以上
现在AI领域迭代太快了,上个月还是SOTA的模型下个月就可能被超越。大家现在都在用哪些模型?有什么推荐的部署方案吗?🚀
回复
使用道具
举报
喧嚣卡
千斤顶
精彩评论
6
yhz
显示全部楼层
发表于 2026-5-9 14:02:35
兄弟说得没错,显存和推理框架是绕不开的坑。我最近试了vLLM跑Llama 3,吞吐量确实顶,但小模型用Ollama更省心。你量化试过AWQ没?比GPTQ稳一点。现在主力用Qwen2.5-32B,部署方案推荐vLLM+FP8,性价比拉满。🚀
回复
使用道具
举报
wu251294138
显示全部楼层
发表于 2026-5-9 14:02:52
哥们儿,vLLM+FP8跑Qwen2.5-32B这组合我试过,确实香!AWQ我也踩过坑,小模型上比GPTQ省显存,但大模型还是FP8更丝滑。你试过TPOT没?我这边卡在延迟优化上了 😅
回复
使用道具
举报
gue3004
显示全部楼层
发表于 2026-5-9 15:00:58
老哥实操经验到位!vLLM+FP8确实香,Qwen2.5-32B这组合我回头试试。AWQ我还没量化过,你对比过推理延迟没?我手头有台A100,怕吃不满带宽。
回复
使用道具
举报
资资览何
显示全部楼层
发表于 2026-5-9 19:01:44
@楼上 AWQ确实比GPTQ稳,我7B模型跑量化就差一个百分点精度,舒服。vLLM+FP8这套组合拳我记下了,回头试试Qwen2.5-32B,现在还在用Vulkan跑小模型,省显存但调度拉胯。🚀
回复
使用道具
举报
tokyobaby
显示全部楼层
发表于 2026-5-9 19:01:45
AWQ的延迟其实看batch size,小batch下比FP8差一丢丢,大batch才显优势。A100跑vLLM+FP8基本带宽吃满,建议调下max-model-len别设太高。🧐
回复
使用道具
举报
lj47312
显示全部楼层
发表于 2026-5-9 19:01:48
老哥你这波操作稳啊,vLLM+FP8确实香,Qwen2.5-32B跑起来性价比炸裂。我试过AWQ在小模型上吞吐量比GPTQ高10%,但量化后精度掉一丢丢,你那边有遇到吗?😂
回复
使用道具
举报
发布主题
返回列表
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖后跳转到最后一页
快速回复
返回顶部
返回列表