模型介绍
中文整理# LongCat-Flash-Lite 模型卡片
## 模型简介
LongCat-Flash-Lite 是一个非思考型 68.5B 参数的混合专家(MoE)模型,激活参数约 3B,通过 YaRN 方法支持 256k 上下文长度。该模型基于 LongCat-Flash 架构构建,集成了 N-gram 嵌入表以提升模型性能和推理速度。尽管在嵌入表中分配了超过 30B 参数,LongCat-Flash-Lite 不仅在参数规模相当的 MoE 基线模型中表现更优,还与同规模现有模型具有很强的竞争力,尤其在智能体和编程领域表现突出。
## 主要能力
- *卓越的扩展效率:MoE 的更优替代方案**
通过在多样化场景下进行全面的扩展实验,研究团队确定了嵌入扩展在特定条件下能够实现比增加专家数量更优的帕累托前沿,为模型扩展提供了高效的替代方案。研究还详细阐述了一系列决定嵌入扩展效果的架构因素,包括集成时机、参数预算、哈希冲突缓解、超参数配置、嵌入初始化,以及模型宽度和深度的影响。
- *专用系统优化带来的卓越推理效率**
与基于 FFN 的专家不同,N-gram 嵌入表本身能够缓解 MoE 层中的 I/O 瓶颈,显著改善推理延迟。此外,模型还引入了专用的 N-gram Cache 和同步内核,共同大幅提升推理效率。
- *强大的智能体和编程性能**
LongCat-Flash-Lite 在智能体工具使用和编程能力方面展现出强大的竞争力,与其模型规模相称。
## 输入输出
该模型为纯文本输入输出模式,支持最长 256k 上下文长度的文本生成任务。
运行要求
- *硬件要求**
至少需要 2 张 GPU(每张 80GB 显存,例如 H100/A100 80GB)
- *软件环境**
- Python >= 3.10
- PyTorch >= 2.6
- Transformers >= 4.57.6
- Accelerate >= 1.10.0
- *部署环境**
LongCat-Flash-Lite 可在单节点(例如 8xH20-141G)上通过张量并行和专家并行组合进行服务。
基本用法
使用 Transformers 库调用模型,支持工具调用功能。模型响应解析和采样设置请参考官方实现文档。
限制
该模型并非针对所有可能的下游应用场景专门设计,也未进行过全面评估。开发者应考虑大型语言模型的已知局限性,包括不同语言间的性能差异,并在将模型部署到敏感或高风险场景前仔细评估准确性、安全性和公平性。开发者及下游用户有责任理解和遵守与使用场景相关的所有适用法律法规,包括但不限于数据保护、隐私和内容安全要求。
许可证
本仓库(包括模型权重和源代码)基于 MIT 许可证发布。任何对本仓库的贡献均基于 MIT 许可证,除非另有说明。该许可证不授予使用美团商标或专利的任何权利。详细条款请参阅 LICENSE 文件。
## 引用
如您发现本工作有用,欢迎引用我们的研究成果。
## 联系方式
如有问题,请联系 longcat-team@meituan.com 或提交 Issue。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
