Galvatron
Galvatron 是一个为 Transformer 模型(包括大语言模型 LLMs)设计的自动分布式训练系统。它利用先进的自动并行技术提供卓越的训练效率。本仓库包含了 Galvatron-2 的官方实现,这是我们最新版本,增加了多项新特性。
Galvatron GitHub: https://github.com/PKU-DAIR/Hetu-Galvatron
支持的并行策略
策略 |
类型 |
支持的变体 |
|---|---|---|
数据并行 (DP) |
基础 |
传统 DP |
分片数据并行 (SDP) |
内存高效 |
ZeRO-1, ZeRO-2, ZeRO-3 |
流水线 (PP) |
模型分割 |
GPipe, 1F1B-flush |
张量 (TP) |
模型分割 |
Megatron-LM 后端, flash-attn 后端 |
序列 (SP) |
数据分割 |
Megatron-SP, Ulysses |
检查点 (CKPT) |
内存高效 |
激活检查点 |
支持的模型
模型类型 |
架构 |
后端 |
|---|---|---|
大语言模型 |
GPT |
Huggingface, flash-attn |
大语言模型 |
LLaMA |
Huggingface, flash-attn |
大语言模型 |
BERT |
Huggingface |
大语言模型 |
T5 |
Huggingface |
视觉模型 |
ViT |
Huggingface |
视觉模型 |
Swin |
Huggingface |