闲社
标题:
Gala-598M开放:单台Mac训练的长上下文研究模型
[打印本页]
作者:
meteor1982
时间:
2026-9-4 17:02
标题:
Gala-598M开放:单台Mac训练的长上下文研究模型
【事件概述】
独立开发者 Arjun Reddy(Hugging Face 用户名 junafinity)于 2026 年 8 月 29 日公开 Gala-598M-MLX。这是一款从零预训练的非 Transformer 语言研究模型,针对 Apple Silicon“统一内存较大、矩阵计算能力相对有限”的硬件特征设计。模型、训练代码、两个检查点、实验日志和五天开发记录均已上传到 Hugging Face。
【模型与开发者】
模型:Gala-598M-MLX
开发者:Arjun Reddy / junafinity
官方发布日期:2026 年 8 月 29 日
总参数:5.98 亿
每 token 激活参数:约 7800 万
训练框架:Apple MLX
模型许可:Apache License 2.0
训练硬件:单台 MacBook,M3 Max 40 核 GPU、128GB 统一内存
日期核对说明:作者在 Hugging Face 发布的技术文章明确标注 2026 年 8 月 29 日;本文采用该日期作为项目公开日期,不把模型仓库后续更新时间当作新的发布事件。
【核心架构与改动】
1. 四个非共享单元:每个单元由 Gated DeltaNet 混合器、稀疏 Hoard MLP、256-token 滑动窗口注意力和第二个 Hoard MLP 组成。循环状态固定为 FP32,不随输入上下文长度线性增长。
2. 稀疏参数池:Hoard MLP 使用 1024 个、每个 64 神经元的路由块,每个 token 只选择其中 32 个,约接触 5.37 亿参数池的 3%,以较低的单 token 计算量保留更大的模型容量。
3. 固定大小长程状态:作者报告,在连续输入约 1050 万个 FineWeb token 的实验里,循环状态保持约 3.07MB,解码速度在不同上下文深度约为每秒 382 至 388 token。该结果是在指定 M3 Max、批量为 1 和作者实现下测得,不是其他硬件上的保证。
4. 近距离精确、远距离摘要式记忆:256-token 滑动窗口负责局部精确回忆,Gated DeltaNet 状态压缩更早内容。作者的 passkey 测试显示,目标在窗口内时全部命中,超出窗口后表现接近随机水平,说明“能流式读取千万 token”不等于能精确找回任意早期事实。
5. 纯 MLX 训练:完整实验在一台 MacBook 上完成,没有使用 CUDA、自定义内核或集群。主检查点训练于 3 亿 FineWeb-Edu token,另有经过 1K、8K、32K 序列课程微调的长上下文检查点;作者称全项目总训练量约 4.2 亿 token。
6. 数值稳定性修复:团队早期用闭式幂乘法计算分块 Delta Rule 的三角逆时出现 FP32 爆炸,后改为分块前向代入。作者公开了失败配置和调试脚本,提醒在非融合 CUDA 环境重写线性注意力时注意这一类数值问题。
【官方实验结果】
在作者构造的对照实验中,Gala 与一个按每 token 激活计算量匹配的 7700 万参数 Transformer 使用相同的 1.2 亿 FineWeb-Edu token、批次顺序和优化器。三次随机种子实验报告的验证损失分别汇总为 Gala 3.816±0.008、Transformer 3.887±0.003;训练到 3 亿 token 后,两者报告为 3.581 与 3.684。
这些数字属于作者在单一数据集、单一硬件和自建对照中的结果。项目尚未完成标准下游任务评测,也没有证明相同优势能扩展到更大模型、更多语种或指令微调场景,因此不能把验证损失差异直接解释为通用能力领先。
【适用对象】
Gala-598M 适合研究 Apple Silicon 本地预训练、MLX、线性注意力、稀疏记忆和固定状态长文本流处理的开发者。它可用于复现实验、测试新型序列架构,或探索日志、文档流等“持续读取但不要求逐字回忆全部历史”的工作负载。
它不适合作为可直接对话的通用助手,也不适合需要从百万 token 前精确检索一个原句的任务。此类需求仍应配合检索系统、全文注意力或显式外部记忆。
【实际影响】
主流 Transformer 的 KV Cache 会随上下文增长,长输入会持续增加内存与读取开销。Gala 展示了另一种设计取舍:让模型保留一个固定大小的压缩状态,再用短滑动窗口保存局部细节,从而使流式读取和解码成本不随历史长度同幅增加。
对于拥有大容量统一内存但算力不及数据中心 GPU 的 Mac,这种“多存参数、少激活参数”的稀疏设计可能比照搬服务器模型结构更匹配硬件。不过目前实现的稀疏路径没有融合 Metal 内核,作者报告训练墙钟时间仍约为匹配 Transformer 的 1.5 倍,架构效率尚未完全转化为训练速度优势。
【限制与使用提醒】
模型只在 FineWeb-Edu 英文数据上训练约 4.2 亿 token,没有指令微调、偏好对齐、工具调用训练或完整安全评测。作者明确称它是研究模型而非聊天机器人:能够生成看似合理的英文,并不代表具备可靠知识、事实性或任务遵循能力。
1050 万 token 实验验证的是固定状态下持续处理和损失变化,不是等价于标准意义的 1050 万 token 精确上下文窗口。超出 256-token 局部窗口后的 passkey 回忆接近随机,关键事实必须依赖外部检索。
所有性能数据来自一台特定 M3 Max;内存、速度和稳定性会随 Mac 型号、MLX 版本、批大小和实现改变。作者还说明 12.8 万 token 的 passkey 评测因耗时未完成。
虽然模型页标注 Apache-2.0,实际使用仍应核对 FineWeb-Edu 数据条款和相关依赖许可。任何面向用户的生成结果都应增加事实校验、内容安全和人工复核。
【官方来源】
Hugging Face 技术文章:https://huggingface.co/blog/junafinity/gala-an-apple-silicon-first-model-trained-on-one
模型与完整实验仓库:https://huggingface.co/junafinity/Gala-598M-MLX
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0