闲社服务运行正常AI智能体自动化平台

Inkling-Small

thinkingmachines/Inkling-Small

发布机构thinkingmachines

下载访问条件魔搭来源

Inkling-Small是一个通用多模态模型,接受文本、图像和音频输入,生成文本输出。支持英语及其他多种语言,适用于多种编程语言。该模型面向开发人员,用于构建AI驱动的应用,包括智能体和工具使用系统、编码助手、聊天机器人和检索增强生成系统。适用于通用对话、指令遵循及其他自然语言和多模态任务。以开放权重发布,支持研究、微调和集成到第三方产品。 参数总量2760亿,活跃参数120亿。支持BF16和NVFP4数值精度。 输入形式:文本为UTF-8编码文本;图像为任意像素图像,最佳

图文理解语音音频编程开发
模型详情

模型介绍

中文整理

Inkling-Small 模型卡片

模型用途

Inkling-Small是一个通用多模态模型,接受文本、图像和音频输入,生成文本输出。支持英语及其他多种语言,适用于多种编程语言。该模型面向开发人员,用于构建AI驱动的应用,包括智能体和工具使用系统、编码助手、聊天机器人和检索增强生成系统。适用于通用对话、指令遵循及其他自然语言和多模态任务。以开放权重发布,支持研究、微调和集成到第三方产品。

主要能力

模型类型为多模态自回归Transformer。架构为42层仅解码器Transformer,采用稀疏专家混合(MoE)前馈网络:每个令牌路由到256个专家中的6个,另外2个共享专家对所有令牌激活。注意力机制采用局部和全局层混合设计。模型原生支持多模态:图像通过分层分块编码器处理,音频通过离散令牌编码处理,所有模态投影到共享隐藏空间并由解码器联合处理。

参数总量2760亿,活跃参数120亿。支持BF16和NVFP4数值精度。

输入输出

输入形式:文本为UTF-8编码文本;图像为任意像素图像,最佳性能要求图像尺寸介于40像素至4096像素之间;音频为WAV格式,采样率16kHz,最佳性能要求音频时长不超过2分钟。输出形式为UTF-8编码文本。

运行要求

支持使用以下开源库进行本地部署:SGLang、vLLM、TokenSpeed、Unsloth、Huggingface。也可通过第三方推理提供商获取API访问。

基本用法

可通过Tinker Playground试用,或通过Tinker Cookbook使用API访问。

限制

模型可能产生幻觉(生成看似合理但事实不正确或无依据的内容),偶尔无法精确遵循指令,在长对话中性能可能下降。与其他基于网络数据和合成数据训练的大规模模型一样,Inkling-Small可能反映训练数据中存在的偏见,包括人口、文化或语言偏见,在训练数据中代表性较少的语言、方言或主题领域可能表现不均。模型知识限于训练截止日期前的事件,之后的发展变化可能未反映。建议在涉及高风险或安全关键场景的用途中,对输出进行适当的人工监督和审核,而非仅依赖模型输出。在部署前应针对具体用例、语言和用户群体进行独立的性能、安全性和公平性评估。对于医疗、法律或安全关键决策领域,需进行额外微调、领域特定验证和人工监督。

许可证

训练数据文档。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部