简介
StableLM 是由 Stability AI 官方开源维护的大语言模型系列项目。该项目持续发布高质量的轻量级与基础语言模型检查点,并提供完整的架构说明、训练配置与评测数据。作为开源大模型生态的重要参与者,StableLM 系列旨在降低大语言模型的研发与使用门槛,涵盖 3B、7B、13B 等多种参数规模,助力学术界与开发者社区进行模型研究、微调与落地应用。
主要模型与技术特性
目前仓库重点维护并详细披露了 StableLM-3B-4E1T 模型的技术细节,其核心特性如下:
- 模型架构:采用类似 LLaMA 的 Decoder-only Transformer 架构。主要优化包括:使用带可学习偏置项的 LayerNorm 替代 RMSNorm;应用 Rotary Position Embeddings(仅作用于前 25% 的头嵌入维度以提升计算吞吐量);采用 GPT-NeoX 分词器。
- 参数配置:总参数量约 27.95 亿(3B),隐藏层维度 2560,共 32 层注意力头,最大支持 4096 的序列长度。
- 训练数据:基于 Hugging Face Hub 上的大规模开源语料进行清洗与混合,数据源涵盖 Falcon RefinedWeb、RedPajama-Data(剔除 Books3 等子集)、The Pile 以及 StarCoder。
- 训练策略研究:项目聚焦于“重复数据训练”对下游性能的影响。StableLM-3B-4E1T 在约 1 万亿(1T)Token 上进行了 4 个 Epoch 的训练,验证了在数据受限场景下,适度增加训练轮数对模型 Loss 的影响微乎其微,为小参数模型(Small Language Models)的数据扩展提供了实证参考。
此外,仓库还归档了 StableLM-Alpha v2(3B/7B 参数)及 StableVicuna-13B(基于 LLaMA-13B 进行 RLHF 微调的版本)等历史模型权重。
性能评估与在线体验
- 基准评测:在基于
lm-evaluation-harness 的 Zero-shot 评测中,StableLM-3B-4E1T 在 ARC Challenge/Easy、BoolQ、HellaSwag、PIQA、SciQ、Winogrande 等主流数据集上,整体平均得分与同量级开源模型(如 Falcon-7B、MPT-7B、Qwen-7B)表现相当,验证了其在有限参数下的高效学习能力。
- 交互式体验:开发者可通过 Hugging Face Spaces 直接在线对话体验
StableLM-Tuned-Alpha-7B 调优版本。
适用场景
- 下游任务微调:基座模型经过大规模公开文本训练,官方推荐开发者直接基于 StableLM-3B-4E1T 针对特定垂直领域或任务进行 Fine-tuning。
- 模型训练策略研究:适合研究人员探索小参数模型的数据配比、多 Epoch 训练机制、Token 重复使用效应及算力优化策略。
- 轻量级 AI 服务部署:3B/7B 的参数量级对显存与算力要求相对较低,便于在个人工作站、边缘设备或资源受限的服务器环境中部署本地化语言模型推理服务。
开源协议
代码仓库遵循 Apache-2.0 许可证。模型权重根据发布版本不同,分别采用 CC BY-SA-4.0 或 CC BY-NC-SA-4.0 协议授权,具体使用范围请参照各模型对应的发布说明。