模型介绍
中文整理# KAT-Coder-V2.5-Dev 模型卡片
模型概述
KAT-Coder-V2.5-Dev 是一个开源的代码智能体模型,基于 Qwen3.6-35B-A3B 进行后训练。该模型为 MoE(混合专家)架构,总参数量 35B,激活参数量 3B。
模型用途
该模型主要用于代码智能体任务(Agentic Coding),包括代码编写、代码修复、软件工程任务等。模型仅支持文本输入输出,不包含视觉或多模态组件。
## 主要能力
该模型在代码智能体领域取得了同类参数规模模型的领先水平。通过监督微调(SFT)和强化学习(RL)训练,模型在以下方面进行了优化:
- 异常工具调用标签问题显著改善(9.34% 降至 0.28%)
- 单轮连续重复问题完全消除(0.34% 降至 0%)
## 基准性能
模型在多个代码基准测试中的表现:
| 基准测试 | KAT-Coder-V2.5-Dev |
|---------|-------------------|
| SWE-bench Verified | 69.40% |
| SWE-bench Multilingual | 63.00% |
| SWE-bench Pro | 45.96% |
| Terminal-Bench 2.1 | 41.02% |
| PinchBench | 93.43% |
| Scicode | 44.20% |
| KAT-Code-Bench | 46.21% |
注:所有指标均为内部复现结果,使用统一标准化流程评估。
## 输入输出
- **输入**:文本形式的代码任务描述、对话上下文
- **输出**:文本形式的代码回复、工具调用
- **上下文长度**:原生支持最长 262,144 个 token
- **工具调用**:支持工具调用功能
运行要求
### 兼容性
模型兼容以下推理框架:
- Hugging Face Transformers
- vLLM(推荐版本 >= 0.19.0)
- SGLang(推荐版本 >= 0.5.10)
- KTransformers
### 硬件要求
- 使用 vLLM 或 SGLang 时,建议使用 8 GPU 进行张量并行
- 使用 Hugging Face Transformers 时,需要安装 accelerate 以支持多 GPU 分片加载
### 重要说明
该版本为纯语言模型权重,不包含视觉塔。使用 vLLM 时必须添加 --language-model-only 参数,否则会因缺少视觉权重而启动失败。
基本用法
### 通过 API 服务
模型支持 OpenAI 兼容 API,可通过以下框架部署:
- SGLang
- vLLM
- KTransformers
- Hugging Face Transformers
### 使用 Chat Completions API
模型支持标准的聊天补全接口。默认情况下,模型会在回复前进行思考。如需直接获取回复,可通过 API 参数配置。
模型还支持保留历史消息的思考轨迹,这一功能对智能体场景特别有益,可增强决策一致性并优化推理效率。
### 长文本处理
对于超过 262,144 token 限制的长程任务,建议使用 RoPE 缩放技术(如 YaRN)来处理长文本。
限制
- 该版本为纯文本模型,不包含视觉或多模态能力
- 仅发布语言模型权重,视觉/多模态组件未包含且不可用
- 部分框架在加载时可能尝试构建多模态组件,需使用对应选项跳过
许可证
本模型卡片中未提供具体的许可证信息。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
