全ニュース

技術ニュース 962 件

本機推論

gemma4.c、約700行の純粋なCでGemma 4 E2B推論を再現、単一マシンのCPU実測で汎用フレームワークを上回る

オープンソースプロジェクトのgemma4.cは、tokenizer、Transformer、KV cache、sampling、SIMD kernelを単一のCファイルに収め、外部の推論ライブラリを必要としない。作者によるRyzen 7 7700でのテストではllama.cppを上回ったが、この成果は固定モデル、単一のCPU backend、専用のデータレイアウトに依存しており、汎用的な性能評価とは見なせない。

代理框架

OpenClaw 2026.8.1、エージェントセッションをデバイス横断実行へ移行し、永続状態で進捗を追跡

OpenClawの新バージョンでは、ワークスペースとエージェントセッションをペアリング済みデバイスまたはクラウドworkerへディスパッチでき、再接続後も進捗、分岐、共有権限が保持される。今回のアップグレードではOpenAIモデルのルーティングとプラグインSDKも変更されるため、デプロイ担当者は事前に状態をバックアップし、移行チェックを実行する必要がある。

AI 推論與安全

Speculative Probing、MTPドラフトヘッドを再利用し、少数のソフトプロンプトでリアルタイムLLM安全監視を実現

Cornell Techの研究者らは、もともと投機的デコーディング向けだったMTP/Eagle3モジュールを、主モデルを再実行せずに済む系列分類器へ転用した。この手法で訓練するパラメータは約1.6万~2万個にすぎないが、性能はドラフトヘッドの品質と数千件のタスク固有ラベルに左右される。

AI coding agent

openJiuwen、シングルエージェントとSwarmの実行セマンティクスを統一し、診断と目標に応じてcoding harnessを動的に調整

openJiuwenは、能力の組み合わせ、サブエージェント、マルチエージェント協調を共通の実行基盤に統合し、LSP診断、コンテキスト管理、明確な停止条件によって長時間タスクを調整する。チームは2つのcoding agentベンチマークで、選定したリーダーボード結果を上回ったと報告しているが、比較には依然として異なるモデル、ツール、プロンプト設定が混在している。

Inference systems

vLLM 0.28、ディスク階層KVキャッシュを追加、Model Runner V2はエンコード/プリフィル/デコード分離に対応

vLLM 0.28.0では、KVキャッシュを階層化してディスクへオフロードできるようになり、外部のセカンダリストレージマネージャーも利用可能になった。これにより、長いコンテキストを扱うサービスは、GPUおよびメインメモリの容量だけに制約されなくなる。新バージョンではKimi-K3、DeepSeek V4、投機的デコード、E/P/D分離も進展した一方、複数のデフォルト値と依存インターフェースが変更されている。

AI coding tools

DeepSeek Harness 0.1.2 Alpha、サブエージェントのモデル選択を開放し、ACPの権限・キャンセル制御を拡充

DeepSeek Harnessの新版では、メインエージェントが認可された範囲内で、サブエージェントのプロバイダー、モデル、推論強度、最大出力長を選択できるようになった。さらに、ACPのセッション、MCP、権限、キャンセルの各インターフェースも完成した。ネットワークおよび外部モデルとの統合も拡大したが、公式はサンドボックスと承認機構を安全な分離手段と見なすことはまだできないと明確に警告している。

代理記憶與本機 AI

Hillock 0.6、双極性ハイパーベクトルでエージェントの記憶を検索し、しきい値未満ならLLM呼び出しをスキップ

Hillockは、事実トリプル、Hebbian連想重み、1万次元のハイパーベクトルを組み合わせ、ローカルハードウェア上で質問に回答できるデータがあるかを事前に判定する。0.6ではtoken単位のMaxSimとマルチホップ経路エンコーディングが追加されたが、ゲート精度は現時点で約56%にとどまり、依然として研究プロトタイプの段階にある。

AI 代理與工程軟體

Cogram Studio、MCPでヘッドレスFreeCADを開放し、エージェントによるCAD・BIMファイルの直接作成を可能に

Cogramは、人間とAIエージェントが共同利用できるクラウドモデリング環境を公開した。FreeCAD 1.1、OpenCASCADEジオメトリカーネル、MCPツールセットを使用して3Dモデルや図面を処理する。エージェントは範囲が限定され、反復的な修正を伴うモデリング作業をすでに実行できるが、複雑なモデルについては、依然としてエンジニアによる形状、寸法、ソリッド制約の確認が必要だ。

本機推論與模型量化

GSQ-RCO、テンソル感度に応じてビットを割り当て、Qwen3.8-27Bを8.4GBの標準GGUFに圧縮

ISTA DASLabは、GSQで量子化値を学習し、RCOで固定容量の範囲内における各テンソルの精度を選択した、3種類の混合精度Qwen3.8-27B量子化モデルを公開した。最小版はわずか8.4GBで、llama.cpp、Ollama、LM Studioから直接読み込める。ただし、ほぼ無損失という結論は、現時点ではチーム自身の評価に基づいている。

開源代理應用

OpenMAIC 1.0、割り込み可能なエージェントワークベンチを追加 コース生成状態をサーバーで永続化

OpenMAIC 1.0は、単発の授業ジェネレーターを、コースの計画・修正・再開が可能なエージェントへと拡張し、イベントストリーミングとPostgreSQLでセッションを保存する。新版では20種類の組み込みスキルとベンダー中立のツールインターフェースを公開したが、一般公開するには、ユーザー分離と長時間のメディアタスクを処理するジョブスケジューリングを別途実装する必要がある。

代理協定/供應鏈安全

MCP Registryの実測で隠れたシステムプロンプトが明らかに:接続可能な5,000超のサーバーがinstructionsを返却

Fetchgateが公式Registryに登録された15,329件のリモートURLに対して読み取り専用のハンドシェイクを実行したところ、接続可能な5,462エンドポイントがサーバーレベルの指示を送信していた。問題はプロンプトインジェクションだけでなく、ターンごとに繰り返し発生するコンテキストコストや、ツール間での暗黙的な優先順位争いにも及ぶ。