AI 基礎設施
Hetzner 試行 OpenAI 相容推論 API,以單一 FP8 MoE 模型測試歐洲託管需求
Hetzner 悄然開放實驗性 LLM 推論服務,目前僅提供 Qwen3.6-35B-A3B-FP8,現有 OpenAI SDK 可透過替換 base URL 接入。社群低負載測試錄得 153 毫秒中位首 token 延遲與約 224 token/s,但服務沒有 SLA、計費或生產保證。
Archive
共 977 篇技術新聞
AI 基礎設施
Hetzner 悄然開放實驗性 LLM 推論服務,目前僅提供 Qwen3.6-35B-A3B-FP8,現有 OpenAI SDK 可透過替換 base URL 接入。社群低負載測試錄得 153 毫秒中位首 token 延遲與約 224 token/s,但服務沒有 SLA、計費或生產保證。
AI 研究與推論
一項針對未發布 27B 混合模型的推論端實驗顯示,模型在約 100 萬 token 只找回 21.4% 的植入資訊,遠低於 3.3 萬 token 時的 92.9%。位置縮放、注意力溫度與更高精度 KV cache 均未顯著修復問題,檢索能力則高度集中於 18 個注意力頭。
AI 評測與安全
QuantiBias 將模型與提示固定,只改變權重精度,測量量化前後的多語開放式偏見、拒答與選擇題表現。作者發現常見短式安全指標大致持平,但獨立評審模型仍把約 24% 至 27% 的開放式回答判為支持刻板印象。
推論與量化
Hugging Face Diffusers 現可直接載入 Nunchaku Lite 檢查點,以 4-bit 權重與啟用值執行擴散 Transformer。官方單機測試最高把峰值顯存約減半並達 1.8 倍加速,但硬體覆蓋及畫質驗證仍有限。
機器人與模擬
NVIDIA 將 Medical Physics Simulation 納入 Isaac for Healthcare,模擬血管、柔性器械、接觸摩擦與 X 光感測,再以 GPU 平行環境訓練機器人策略。官方示範把一項訓練由五小時以上縮至兩分鐘內,但模擬速度不等同臨床有效性或安全認證。
代理框架與標準
GitHub MCP Server 已支援預定 7 月 28 日定稿的 MCP `2026-07-28` 規格,遠端請求不再依賴 `initialize` 握手及協定層 session。新設計簡化水平擴充,但 Tasks、錯誤碼和自訂客戶端仍有相容性工作要做。
AI security research
研究者宣稱以 32 個 Kimi K3 代理自動產生 fuzz harness、分析崩潰並建立 Redis 遠端執行程式碼 PoC,最快一條攻擊鏈在 27 分鐘內完成。Redis 已修補相關 `RESTORE` 記憶體問題,但攻擊需要有效憑證與特定命令權限,代理自主程度及「19 個零日」仍主要來自研究者自述。
AI coding tools
Open Code Review 將檔案篩選、規則匹配和留言定位交給確定性程式,再讓 LLM 代理搜尋儲存庫上下文並判斷缺陷。官方自測顯示其 token 用量約為 Claude Code 的九分之一,但以精確率換取較低召回率,不能直接取代既有測試與靜態分析。
AI 程式工具
Google Antigravity CLI 新增以 `agent.md` 建立主代理與子代理的機制,並可在 frontmatter 控制 MCP 繼承、可見性及命令執行政策。新版也改善程式碼搜尋串流與代理監控,但檔案式政策能否形成可靠安全邊界仍須實測。
模型與開發者平台
微軟將最高畫質的影像生成模型與高吞吐語音模型同步帶入 Foundry 公開預覽,分別瞄準精細編輯及即時語音代理。官方公布多項產品環境成本與延遲數據,但跨供應商比較仍缺乏一致、可重現的測試條件。
語音 AI/推論系統
SGLang-Omni 新增 MOSS-Transcribe-Diarize 部署路徑,透過 OpenAI 相容端點一次輸出逐段時間戳、文字與說話人標籤。這讓 0.9B 開放模型更容易進入線上服務,但官方效能資料使用的三個評測集目前不是完全公開。
開放模型/代理基礎設施
Upstage 開放 Solar Open 2 權重,以 250B 總參數、15B 每 token 啟用參數處理長流程代理工作。模型只在四分之一層保留 softmax 注意力與 KV cache,但百萬 token 能力及韓文辦公代理成績仍主要來自團隊自評。