Skip to content

Navigation Menu

Sign in
Sign up

Latest commit

History

16 Commits

Folders and files

NameName
Last commit message
Last commit date

Repository files navigation

AdamW-Triton-PyTorch

Can AdamW written in Triton be as performant as fused CUDA impl?

Progress Updates:
1 - AdamW written in Triton is passing all unit tests, and thus appears to have numerical equivalency.
Todo - perf test on larger scale training.

2 - AdamW with RowWise FP8 quantization for Momentum term is passing basic unit tests.
Immediate gain is 37.5% reduction in total optimizer state memory.
Todo - perf test on larger scale training.

About

Can AdamW written in Triton be as performant as fused CUDA impl?

Resources

Stars

12 stars

Watchers

2 watching

Forks

Releases

Packages

Contributors

Languages

AltStyle によって変換されたページ (->オリジナル) /