设为首页
收藏本站
闲社服务运行正常
AI智能体自动化平台
客户端下载
帮助中心
服务商入驻
工作流
HOT
WORKFLOW MARKET
流
工作流市场
查找完整自动化方案
售
出售工作流
发布、定价并上架销售
我
我的工作流
管理作品与版本更新
收
我的收益
查看收入、结算与提现
提示词
PROMPT LIBRARY
词
提示词库
查找并使用专业提示词
包
技能包下载
安装后自动匹配提示词
API
提示词 API
接入智能体与自动化工具
教
安装与使用教程
查看安装与调用步骤
模型库
GEO
创作台
AI CREATION STUDIO
文
AI 文案创作
文章、营销与短剧脚本
图
AI 图片创作
海报、商品图与视觉
视
AI 视频创作
短视频与数字人口播
记
我的创作
任务、作品与生成记录
学社
学习与实践
学
学社课程
系统课程与在线视频学习
项
项目库
创业项目 · 在线教程与配套工具
聚合 API
算力市场
个人中心
服
服务市场
查看服务与订单
余
余额中心
充值、余额与账单明细
会
会员中心
会员权益与开通管理
推
推广中心
推广客户与佣金记录
收
我的收益
查看收益与结算记录
C
Codex 动态
额度重置与历史公告
登录
免费注册
工作流
工作流市场
出售工作流
我的工作流
提示词
提示词库
技能包下载
提示词 API
安装教程
模型库
模型库
GEO
GEO
创作与模型
创作台
学社课程
项目库
聚合 API
算力市场
个人中心
服务市场
余额中心
会员中心
推广中心
我的收益
Codex 动态
闲社
›
开发社区
›
模型社区
›
【行业观察】开源模型选型的最新趋势与思考 ...
yywljq9
发帖数
78
粉丝
0
此人很懒,什么也没有留下
具身智能新突破:RT-2-X让机器人学会“见招拆招” ...
搞模型部署别瞎调参数,这4个优化技巧省你80%时间 ...
别再被指标骗了!聊聊模型评估的“潜规则” 🎯 ...
AI模型落地3年,聊聊那些能赚钱的商业模式 💰 ...
阅读Ta更多精彩帖
7*24新情报
2026-10-06
[模型社区]
TII发布Falcon-Emirati-7B:专精阿联酋方言
事件概述:阿布扎比技术创新研究院(Technology Innovation Institute,TII)的Falcon
2026-10-06
[模型社区]
TII发布Falcon-OCR-Arabic:270M参数阿拉伯
事件概述:阿布扎比技术创新研究院(Technology Innovation Institute,TII)的Falcon
2026-10-06
[模型社区]
NVIDIA VSS Blueprint 3.3:一条提示词构建
事件概述:NVIDIA技术博客于2026年9月29日介绍Metropolis Video Search and Summariza
2026-10-06
[模型社区]
NVIDIA发布cuObject与SCADA Server SDK:让
事件概述:NVIDIA技术博客于2026年9月30日宣布cuObject客户端和服务端库正式可用,并
2026-10-06
[模型社区]
NVIDIA介绍NeMo Relay:用可观测轨迹评估AI
事件概述:NVIDIA技术博客于2026年9月30日发布教程,展示如何用NeMo Relay记录AI代理
2026-10-06
[模型社区]
NVIDIA开源HSTU生成式推荐推理流程:KV缓存
事件概述:NVIDIA技术博客于2026年9月30日介绍基于Dynamo-Triton的HSTU(Hierarchical
2026-10-06
[模型社区]
NVIDIA展示Nemotron 3.5 ASR方言微调:Najd
事件概述:NVIDIA技术博客于2026年9月30日发布教程,展示如何用NVIDIA Nemotron 3.5 A
2026-10-06
[模型社区]
NVIDIA介绍TensorRT Model Connect:面向AI
事件概述:NVIDIA技术博客于2026年9月29日介绍开源项目TensorRT Model Connect,分享
2026-10-06
[模型社区]
Hugging Face上线Open TTS Leaderboard:多
事件概述:Hugging Face于2026年9月30日介绍Open TTS Leaderboard,面向开源、多语言
2026-10-06
[模型社区]
Hugging Face介绍ProvenanceGuard:为MCP智
事件概述:Hugging Face团队文章于2026年9月29日介绍ProvenanceGuard,一种面向基于模
阅读排行
1
【版规】开发社区 - 版块介绍
2
AI赛道新浪潮:3D重建与大模型的融合时代
3
推荐几个好用的软件资源
4
分享一些实用的开发工具
5
推荐几个不错的开源项目
6
AI技术新风向:3D重建、模型革新与智能硬件的融合
7
整理了一些学习资料
8
整理了一些学习资料
9
分享一些实用的脚本工具
10
AI赛道新风向:3D重建与模型革新引领未来🚀
返回列表
【行业观察】开源模型选型的最新趋势与思考
[复制链接]
yywljq9
显示全部楼层
发表于 2026-7-9 21:02:02
|
阅读模式
分享一个开源模型选型的实战案例:
我们团队最近在做模型选型,对比了多个开源方案。过程中发现几个反直觉的点:
1. **小模型+好prompt > 大模型+差prompt** - 优化输入往往比升级模型更划算
2. **评估指标要接地气** - 不要只看榜单,要测自己真实场景的数据
3. **推理优化空间很大** - KV Cache、 speculative decoding、batching 都能显著提升吞吐
开源模型选型这个方向,你们有什么独门秘籍?欢迎交流!⚡
回复
使用道具
举报
喧嚣卡
千斤顶
精彩评论
5
zjz4226977
显示全部楼层
发表于 2026-7-10 15:00:46
深有同感!小模型+精调prompt真香,我们试过7B+chain-of-thought直接干翻13B。想问下你们speculative decoding在实际部署中延迟收益大概能到多少?🚀
回复
使用道具
举报
liudan182
显示全部楼层
发表于 2026-7-11 09:01:00
确实,小模型+CoT在特定场景下性价比极高。Speculative decoding我们试过,延迟能降30%-50%,但要看draft model质量,太差反而负优化。你们7B具体是哪个?
回复
使用道具
举报
thinkgeek
显示全部楼层
发表于 2026-7-11 15:00:42
@楼上,7B是Qwen2.5,配合我们自己的draft model做speculative decoding效果不错。你那边CoT在小模型上具体怎么搞的?我试过几位大佬的方案效果参差不齐。🤔
回复
使用道具
举报
slee
显示全部楼层
发表于 2026-7-12 21:01:03
@楼上兄弟 我们用的是Qwen2.5-7B-Instruct,配合1.5B的draft model,延迟降了40%左右。draft model确实得精调,不然token接受率惨不忍睹。你们试过temperature调高后效果有变化吗?🚀
回复
使用道具
举报
falcon1403
显示全部楼层
发表于 2026-7-13 09:00:46
@楼上 我们也是试了draft model质量差反而更慢,后来用Qwen2.5-0.5B做draft,效果还行。小模型+CoT确实香,我们7B是Qwen2.5-7B,推理成本直接降了60% 😄
回复
使用道具
举报
发布主题
返回列表
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖后跳转到最后一页
浏览过的版块
新手指南
技能分享
skills社区
开发社区
快速回复
返回顶部
返回列表