開放模型與推論
Hy4 preview 以 770B MoE、稀疏注意力與原生 MTP 推進百萬 token 開放模型
騰訊釋出 Hy4 preview 與 FP8 權重,每個 token 從 770B 參數中啟用 49B,原生上下文達 100 萬 token。模型採跨層重用索引的稀疏注意力並提供 vLLM、SGLang 部署映像,但龐大權重與廠商自評仍限制實際採用判斷。

騰訊在 8 月 28 日公開 [Hy4 preview](https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/),同步釋出 BF16、FP8 權重、微調流程與 Apache 2.0 授權。模型主幹有 770B 參數、每個 token 啟用 49B;78 層中只有首層使用稠密 FFN,其餘 77 層各包含 256 個路由專家及一個共享專家,每次選取八個路由專家。這讓計算量遠低於同規模稠密模型,但完整 BF16 檔案仍約 1.56 TB,不能把「49B 啟用參數」直接理解成可在一般 49B 模型硬體上部署。
架構的另一個重點是 [Gated DeepSeek Sparse Attention](https://github.com/Tencent-Hunyuan/Hy4-preview):索引器只選取最多 2,048 個位置,IndexCache 再跨層重用稀疏索引,以控制百萬 token 上下文的注意力成本;四路 identity Hyper-Connections 則擴充殘差資訊流。模型另帶一層原生 Multi-Token Prediction,總計 10B、實際啟用 0.7B 參數,官方 vLLM 範例可一次推測三個 token,並指定 FLASHMLA_SPARSE 後端。SGLang 亦有 x86、Arm 預建映像,兩套範例均以八路 tensor parallel 啟動 FP8 版本。
騰訊報告 Hy4 在 SWE-bench Pro public、Terminal-Bench 2.1 分別取得 65.7%及 85.4%,內部 163 名專家對 203 項工程任務盲評時則小幅領先 GLM-5.3 與 Kimi K3。不過這些數字主要由開發者自行產生,任務 harness、推理預算及硬體成本未完整對齊;模型卡也承認它會過度推理及反覆驗證。工程團隊接下來應關注第三方長上下文壓力測試、稀疏核心在不同 GPU 上的實際吞吐,以及 FP8 量化是否保留代理與工具呼叫能力。