最新模型
Aleph Alpha、78B MoEモデル「Kolibri-1」を公開 混合アテンションで100万トークンのコンテキストに対応
Kolibri-1はApache 2.0ライセンスのオープンウェイトモデルで、トークンごとの有効化パラメーター数は約3.46B。ドイツ語・英語のバイリンガル利用、文書処理、ツール呼び出しを主な用途とする。100万トークンのコンテキストウィンドウは、ネイティブの256kの学習長を超えて拡張したもので、公式は複雑なタスクにはより短いコンテキストを推奨している。

Aleph Alphaは10月3日、約78.1BパラメーターのMixture of Expertsモデル「Kolibri-1」の重みと設定ファイルをApache 2.0ライセンスで公開した。同モデルはドイツ語と英語に重点を置き、調整可能な思考モードとツール呼び出しを備える。開発者は自らモデルをデプロイし、長文書への質問応答、構造化データの抽出、エージェントワークフローに利用できる。公式発表
技術面の焦点は、大規模モデルの計算コストと長いコンテキストのコストをどう抑えるかだ。Kolibriは50層すべてにMoEを採用し、各層に384個のルーティングエキスパートを配置する。各トークンではそのうち6個と共有エキスパート1個が選択され、有効化されるパラメーター数は約3.46Bとなる。アテンションは、512トークンのスライディングウィンドウを使う40層と、グローバルアテンションを使う10層で構成される。これにより大半の層で長系列のコストを抑えられるが、重み全体をメモリに保持する必要があるため、有効化パラメーター数だけからデプロイに必要な容量を見積もることはできない。モデルカード
100万トークンのコンテキストウィンドウには明確な制約もある。モデルはまず16k系列で事前学習され、その後64kの中間学習と256kの長文コンテキスト適応を経ている。ネイティブの学習長は262,144トークンだ。公式によると、位置エンコーディングがスライディングウィンドウ層でのみ使われるため、位置スケーリングを調整せずに拡張でき、1,048,576トークンまで検証済みだという。ただし、複雑なタスクやレイテンシー、スループットを重視するサービスでは、256k以下の利用が推奨されている。実運用では、コンテキストウィンドウの容量、複数区間をまたぐ検索、タスク全体の成功率を分けて検証する必要がある。モデルカード
デプロイにはaleph-alpha-inferenceが提供するvLLMプラグインを使い、kolibri1推論およびツール呼び出し用パーサーを設定する。思考の強度はチャットテンプレートでnone、low、medium、highから指定する。256kを超えるコンテキストでサービスを提供する場合は、最大系列長も明示的に上書きする必要がある。デプロイ手順
公式は、根拠となる証拠がない場合に回答を拒否するよう訓練を強化したと説明しており、企業向けRAGの観点から実務的な研究価値がある。ただし、公開時の性能比較はベンダー自身による評価だ。中国語は対象言語ではないため、繁体字中国語を使うチームは、バイリンガル文書の処理、拒否応答の品質、ツール引数の正確性、長系列でのGPUメモリ使用量を先に検証し、既存のワークロードに適するかを判断したい。公式技術解説