llama: add support for QRWKV6 model architecture (#11001)

llama: add support for QRWKV6 model architecture (#11001)

* WIP: Add support for RWKV6Qwen2

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* RWKV: Some graph simplification

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* Add support for RWKV6Qwen2 with cpu and cuda GLA

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* RWKV6[QWEN2]: Concat lerp weights together to reduce cpu overhead

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* Fix some typos

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* code format changes

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* Fix wkv test & add gla test

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* Fix cuda warning

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* Update README.md

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* Update ggml/src/ggml-cuda/gla.cu

Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>

* Fix fused lerp weights loading with RWKV6

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>

* better sanity check skipping for QRWKV6 in llama-quant

thanks @compilade

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>
Co-authored-by: compilade <git@compilade.net>

---------

Signed-off-by: Molly Sophia <mollysophia379@gmail.com>
Co-authored-by: Georgi Gerganov <ggerganov@gmail.com>
Co-authored-by: compilade <git@compilade.net>

This commit is contained in:

Molly Sophia

2025-01-10 09:58:08 +08:00

• committed by

GitHub

parent c6860cc734

commit ee7136c6d1

No known key found for this signature in database

GPG key ID: B5690EEEBB952194

23 changed files with 862 additions and 124 deletions

									
										1

src/llama-hparams.h
									
										View file
										
				@ -76,6 +76,7 @@ struct llama_hparams {

				    uint32_t time_mix_extra_dim     = 0;

				    uint32_t time_decay_extra_dim   = 0;

				    uint32_t wkv_head_size          = 0;

				    uint32_t token_shift_count      = 2;

				    float    rope_attn_factor = 1.0f;

				    float    rope_freq_base_train;

Rows
Columns

llama: add support for QRWKV6 model architecture (#11001)

1 src/llama-hparams.h Unescape Escape View file

1

src/llama-hparams.h

View file