闲社服务运行正常AI智能体自动化平台

闲社模型中心

模型找得到,
下载更顺手。

用中文看懂模型能力、适用场景和运行条件,再通过国内镜像下载固定版本。

中文介绍原始出处国内镜像直连
按需求搜索不必记住模型名称

你想用模型完成什么?

支持按模型名称、作者和用途查找

60当前结果
固定版本避免文件混用
镜像直传不经闲社中转
按用途浏览先选任务,再看模型
清空筛选

精选模型

从已核对的模型开始

图文理解

Bunny-v1_1-Llama-3-8B-V

BAAI
国内镜像

Bunny-v1.1-Llama-3-8B-V Bunny是一系列轻量级但功能强大的多模态模型。该模型基于SigLIP视觉编码器和Llama-3-8B-Instruct语言模型构建,采用S²-Wrapper技术,支持图像和文本的多模态理解与处理。 提供多种即插即用的视觉编码器选择,包括EVA-CLIP和SigLIP。支持多种语言骨干模型,包括Llama-3-8B、Phi-1.5、StableLM-2、Qwen1.5、MiniCPM和Phi-2。通过从更广泛的数据源中进行精选,

中文资料固定版本完整下载方法

图文理解

Emu3-Chat-hf

BAAI
国内镜像

Emu3是一个开源多模态模型,通过next-token prediction(下一个token预测)任务进行训练。通过将图像和文本标记化为离散空间,Emu3在多模态序列混合数据上从头训练单个transformer。它是基于transformer架构的自回归语言模型。 图像生成:能够根据文本输入生成高质量图像,只需预测下一个视觉token。支持灵活的分辨率和风格。 视觉语言理解:具备强大的视觉语言理解能力,能够感知物理世界并提供连贯的文本响应。该能力不依赖CLIP和预训练LLM

中文资料固定版本完整下载方法

图文理解

Emu3-Gen-hf

BAAI
国内镜像

Emu3: Next-Token Prediction is All You Need Emu3是一个开源多模态模型,通过next-token prediction任务进行训练。通过将图像和文本标记化为离散空间,Emu3在多模态序列混合数据上从头训练单个transformer。它是基于transformer架构的自回归语言模型。 图像生成:Emu3能够根据文本输入生成高质量图像,只需预测下一个视觉token。支持灵活的分辨率和风格。

中文资料固定版本完整下载方法

图文理解

Aquila-VL-2B-llava-qwen

BAAI
国内镜像

Aquila-VL-2B是一个视觉语言模型(VLM),基于LLava-one-vision框架开发,用于处理图像和文本的多模态理解与生成任务。 该模型采用Qwen2.5-1.5B-instruct作为语言模型基座,配合siglip-so400m-patch14-384视觉编码器。模型在自建的Infinity-MM数据集上训练,该数据集包含约4000万图像-文本对,由开源互联网数据和利用开源VLM生成的合成指令数据组成。

中文资料固定版本完整下载方法
国内镜像

视觉语言模型(Vision-Language Model,VLM) 基于开源数据集 Infinity-MM 训练 该模型能够处理图像和文本输入,进行视觉问答、视觉推理等任务。在多个视觉语言基准测试中进行了评估,包括 MMMU、MMStar、MMBench、MathVista、HallusionBench、OCRBench、AI2D、MMVet 等。

中文资料固定版本完整下载方法
国内镜像

Recon2Reason Reasoning 4B Recon2Reason Reasoning 4B 是一个40亿参数规模的视觉语言模型,专门用于室内和具身场景的空间推理任务。 该模型基于 Qwen3-VL-4B 微调而成,能够从视觉输入中推理度量距离、相对位置、物体配置和空间关系。在度量空间推理和定性空间推理基准测试中表现优异。

中文资料固定版本完整下载方法

图文理解

deepseek-vl-7b-chat

deepseek-ai
国内镜像

DeepSeek-VL是一个开源的视觉语言模型,旨在用于现实世界的视觉和语言理解应用场景。 DeepSeek-VL具备通用多模态理解能力,能够处理以下类型的内容:逻辑图表、网页、公式识别、科学文献、自然图像,以及复杂场景中的具身智能任务。 该模型支持最高1024x1024分辨率的图像输入。模型基于图像输入进行理解和推理,并输出相应的文本响应。

中文资料固定版本完整下载方法

图文理解

deepseek-vl-1.3b-chat

deepseek-ai
国内镜像

DeepSeek-VL是一个开源视觉语言模型,旨在用于现实世界的视觉和语言理解应用。 DeepSeek-VL具备通用多模态理解能力,能够处理以下类型的内容: 视觉输入:支持384 x 384分辨率的图像输入

中文资料固定版本完整下载方法

图文理解

deepseek-vl2-tiny

deepseek-ai
国内镜像

DeepSeek-VL2 是一个先进的混合专家(Mixture-of-Experts)视觉语言模型系列,旨在处理多模态理解任务。 该模型在以下任务中表现出色:视觉问答、光学字符识别、文档理解、表格理解、图表理解以及视觉定位。 模型系列包含三个变体,激活参数分别为:DeepSeek-VL2-Tiny(1.0B)、DeepSeek-VL2-Small(2.8B)和 DeepSeek-VL2(4.5B)。与具有相似或更少激活参数的开源 dense 模型和 MoE 模型相比,Deep

中文资料固定版本完整下载方法

图文理解

deepseek-vl2-small

deepseek-ai
国内镜像

DeepSeek-VL2 是先进的混合专家(MoE)视觉语言模型系列,在其前代DeepSeek-VL基础上进行了显著改进。该系列包含三个变体:DeepSeek-VL2-Tiny(1.0B激活参数)、DeepSeek-VL2-Small(2.8B激活参数)和DeepSeek-VL2(4.5B激活参数)。DeepSeek-VL2基于DeepSeekMoE-16B构建。 DeepSeek-VL2在多种任务上展现出卓越能力,包括但不限于:视觉问答、光学字符识别(OCR)、文档理解、表

中文资料固定版本完整下载方法

图文理解

deepseek-vl2

deepseek-ai
国内镜像

DeepSeek-VL2 是一款先进的混合专家(MoE)视觉语言模型系列,旨在提升多模态理解能力。 该模型在以下任务中表现出色:视觉问答、光学字符识别、文档理解、表格理解、图表理解以及视觉定位。 DeepSeek-VL2-Tiny:1.0B 激活参数

中文资料固定版本完整下载方法

图文理解

DeepSeek-OCR

deepseek-ai
国内镜像

DeepSeek-OCR:视觉-文本压缩模型 面向视觉-文本压缩任务的光学字符识别模型 测试环境:Python 3.12.9 + CUDA 11.8

中文资料固定版本完整下载方法

图文理解

DeepSeek-OCR-2

deepseek-ai
国内镜像

DeepSeek-OCR 2: Visual Causal Flow 支持动态分辨率处理,可处理多种尺寸的图像输入 支持动态分辨率输入,默认配置为 (0-6)×768×768 + 1×1024×1024 图像尺寸,输出 (0-6)×144 + 256 个视觉token

中文资料固定版本完整下载方法

图文理解

DeepSeek-V4-Flash-Vision-Exp

deepseek-ai
国内镜像

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek-V4 系列中首个实验性多模态模型。该模型在 DeepSeek-V4-Flash 架构基础上加入视觉模块,通过持续训练解锁视觉理解能力。 该模型在多模态代理能力方面相比 DeepSeek-V4-Flash-0731 有显著提升,同时在纯文本代理任务上保持相当的表现。支持视觉理解与文本处理的多模态交互。 文本代理能力测试中,该模型在 Terminal Bench 2.1 得分 83.9,NL2Repo

中文资料固定版本完整下载方法

图文理解

DeepSeek-V4.1-Flash

deepseek-ai
国内镜像

DeepSeek-V4.1-Flash 是一个多模态混合专家(MoE)模型,支持处理图像和文本并以自回归方式生成文本。该模型面向需要长上下文处理能力和高效推理的智能体工作负载。 架构采用因果编码器-解码器(CED),由40层Transformer组成(20层编码器+20层解码器)。 Prefill阶段每token激活8B参数,解码阶段激活16B参数,显著降低输入密集型智能体工作负载的成本。 KV缓存压缩方面,SWA Bounded Replay将持久化KV缓存占用降至Deep

中文资料固定版本完整下载方法
国内镜像

Qwen3-VL-30B-A3B-Thinking Qwen3-VL是Qwen系列中最强大的视觉语言模型,支持从边缘到云端的部署。该模型提供Dense和MoE两种架构版本,以及Instruct和Thinking推理增强版,可根据需求灵活部署。 视觉智能体:可操作PC和移动端图形界面,识别界面元素,理解功能,调用工具并完成任务。

中文资料固定版本完整下载方法
国内镜像

Qwen3-VL是Qwen系列中目前最强大的视觉语言模型。该代模型在各方面进行了全面升级:更出色的文本理解与生成能力、更深入的视觉感知与推理能力、更长的上下文长度、更强的空间与视频动态理解能力,以及更优秀的智能体交互能力。 模型提供Dense和MoE两种架构,涵盖从端侧到云端的多种规模,并提供Instruct版和增强推理的Thinking版,支持灵活按需部署。 视觉智能体:可操作PC/移动端图形界面,识别界面元素、理解功能、调用工具、完成任务。

中文资料固定版本完整下载方法
国内镜像

Qwen3-VL-30B-A3B-Thinking-FP8 这是一个FP8量化版本的Qwen3-VL-30B-A3B-Thinking模型,采用细粒度fp8量化方法,块大小为128,性能与原始BF16模型几乎相同。Qwen3-VL是Qwen系列中最强大的视觉语言模型。 视觉Agent:可操作PC和移动端图形界面,识别界面元素,理解功能,调用工具并完成任务。

中文资料固定版本完整下载方法
没有找到需要的模型?

提交仓库编号和用途,我们核对后收录。

提交收录建议

登录闲社账号后即可提交收录建议。

模型及文件版权归原作者所有。链接检查不等于安全认证或运行验证,使用前请阅读原作者说明与许可。

返回顶部