ホームへ戻る

開源模型與框架

Transformers 5.17が6種類のモデルアーキテクチャを統合、Vision RoPEの再構築によりカスタムモデルの移行が必要に

新版では、HYV4、KimiLinear、NeoMME、および3種類の音声アーキテクチャが標準の`from_pretrained`経路に組み込まれ、生成ループにおけるデバイス同期のオーバーヘッドも削減された。一方、2D/3D Vision RoPEは共通モジュールに集約され、従来のグリッドおよび周波数計算に依存するカスタムモデルは、そのままでは動作しなくなる可能性がある。

Andrew Wippler from Lancaster, USA · CC BY 2.0 · Image source
zh-Hant

Hugging Faceは9月9日、[Transformers 5.17.0](https://pypi.org/project/transformers/5.17.0/)を公開し、従来は専用コードまたはリモートコードを必要としていた6種類のアーキテクチャをフレームワークに統合した。言語モデルにはHYV4 PreviewとKimiLinearが含まれる。前者は公式ドキュメントで780B MoEと説明され、tokenごとに約49Bのパラメータをアクティブ化する。後者は、大部分のKimi Delta Attention層と、周期的に配置されたMLAによるfull attentionを組み合わせている。HYV4チェックポイント内のmulti-token prediction層は現時点では実行されず、ロード時に関連する重みが無視されるため、「ロード可能」であることを元の推論スタックが完全に再現されることと同一視してはならない。

マルチモーダル分野では、NeoMMEが単一の双方向Transformerでテキストtokenと生の画像patchをエンコードし、文書検索向けのlate-interaction/dense共同目的関数を採用したバージョンも備える。音声分野にはVibeVoice、Fun-ASR-Nano、Canary-1B-v2が追加され、それぞれ長時間・複数話者の音声合成、中国語・英語・日本語および方言やアクセントの音声認識、多言語文字起こしと音声翻訳に対応する。これらの統合がもたらす実際の価値は、共通のAutoClass、processor、デプロイインターフェースを利用できる点にあり、各モデルの品質がフレームワークチームによって独立に検証済みだと宣言するものではない。

今回、最も注意すべき破壊的変更はVision RoPEである。フレームワークは、各視覚モデルが個別に実装していた2D/3D rotary frequency計算を`modeling_rope_utils.py`へ集約した。下流モデルがattention層をオーバーライドしている場合、独自に位置グリッドを生成している場合、または従来のパラメータ形状に依存している場合、アップグレード後にロードエラーが発生したり、気づきにくい出力のずれが生じたりする可能性がある。デプロイ担当者は、重みが正常にロードされたことを確認するだけでなく、固定画像、位置インデックス、logitsのスナップショットを用いて回帰テストを実施すべきである。

生成レイヤーでは、各デコードステップで不要だったアクセラレーター同期も削除され、リモートファイルのダウンロード、VibeVoiceの量子化キャッシュ、キャッシュなしのpaged attentionに関する問題も修正された。これらの修正によってレイテンシーと正確性が改善する可能性はあるものの、現時点では複数のハードウェアを対象としたend-to-endベンチマークは存在しない。エンジニアリングチームは今後、各新モデルに対する専用推論バックエンドの対応状況と、Vision RoPE移行後の互換性に関する報告を注視すべきである。

出典

  1. Transformers 5.17.0 package and publication provenance
  2. Transformers 5.17.0:六種架構與 Vision RoPE 重構
  3. Transformers releases