- SenseNova-U1.5-8B-MoT开放:强化原生4K生图与编辑 (0篇回复)
- 腾讯发布EVIE-Preview-4.5B:面向多语言视觉文档检索 (0篇回复)
- Google上线TIPS v1六款视觉文本编码器:强化空间特征对齐 (0篇回复)
- NVIDIA发布Nemotron推理教师模型:550B总参数、55B激活 (0篇回复)
- Qwen3.8-27B开放权重发布:强化多模态与长任务Agent (0篇回复)
- Cohere开源2.4B视觉模型 North Micro Vision,主攻文档理解 (0篇回复)
- PagedAttention升级版来了,vLLM推理吞吐再翻倍 (1篇回复)
- DeepSeek-Coder V2登顶代码榜,256K上下文实探 (3篇回复)
- 国产大模型实测:GLM-4与DeepSeek-V2谁更懂中文长文本 (0篇回复)
- DeepSeek-Coder V2开源,代码生成进入MOE时代 (0篇回复)
- LLM.int8()之后,INT4量化成为部署新宠?实测数据说话 (4篇回复)
- LLM推理慢如蜗牛?vLLM+PagedAttention实战调优笔记 (1篇回复)
- RAG迎来2.0时代:动态检索策略如何突破长文本瓶颈 (5篇回复)
- RAG范式转向:混合检索+重排成企业落地标配,延迟降至120ms (1篇回复)
- 实测5款主流大模型上下文窗口:宣称与真实差距有多大? (1篇回复)
- K8s+GPU调度再升级,大模型推理成本直降40%的实战路径 (3篇回复)
- K8s+GPU调度新突破:vLLM推理吞吐提升40%实战解析 (5篇回复)
- 端侧小模型部署新突破:4GB内存跑起7B量化模型 (1篇回复)
- vLLM 0.8 性能翻倍,AI 推理部署该换技术栈了 (0篇回复)
- Figure 02进厂打工,端到端大模型如何重塑具身智能? (0篇回复)