返回首頁

開放模型/推論架構

RWKV7-G1j 將無注意力循環模型擴至 13.3B,長序列解碼維持固定狀態

RWKV 團隊釋出 13.3B 參數的 G1j 基礎模型,並封裝 Transformers、LoRA 與 TileLang 推論支援。固定大小的循環狀態可避開隨上下文增長的 KV cache,但模型沒有安全或能力評測,亦不能直接視為成熟聊天助手。

FyrikNZ · CC0 · Image source
zh-Hant

RWKV 團隊發布 `RWKV7-G1j-13.3B-20260831`,把 RWKV-7「Goose」無注意力循環架構擴至 132.7 億參數。這個 Apache 2.0 基礎模型共有 61 層、4096 維隱藏層、65,536 詞彙及 16,384-token 訓練上下文,權重以 BF16 提供;訓練資料混合網頁、程式碼、合成、指令、對話與推理內容。

技術重點不是單純增加參數,而是解碼狀態不會像 Transformer 的 KV cache 一樣隨序列變長。RWKV-7 以帶向量閘門、上下文學習率及放寬值替換規則的廣義 delta rule 更新固定大小狀態,因此每個生成 token 的理論狀態記憶體與計算量保持固定,同時仍可平行訓練。這對長時間本機代理、串流處理及記憶體受限部署具吸引力,但「固定狀態」不代表整體顯存固定;權重、批次、資料型別與執行後端仍主導實際需求。

這次封裝降低了實驗門檻:模型庫內含 Transformers 5.15+ 遠端程式碼、Rust fast tokenizer、聊天與工具呼叫模板,以及支援 `SFTTrainer`、PEFT LoRA、循環狀態續接的介面。另附 PyTorch fallback 與可選 TileLang 加速;官方提醒完整 TileLang 路徑可能改變浮點運算順序,必須依 GPU、dtype、shape 與檢查點驗證數值一致性。Transformers 載入仍需 `trust_remote_code=True`,生產環境應審查程式並固定 revision。

限制同樣明確:這是 base model,聊天模板只定義提示格式,不代表已做指令對齊;模型卡沒有公布此 13.3B 檢查點的標準能力、安全、偏誤或長上下文評測。需要回滾循環狀態的推測解碼也必須額外保存快照。下一步應觀察獨立基準、真實長序列吞吐量,以及 vLLM、SGLang 等通用伺服器是否能穩定發揮固定狀態的記憶體優勢。

來源

  1. RWKV7-G1j-13.3B-20260831 model card
  2. RWKV-7 “Goose” with Expressive Dynamic State Evolution