最新模型
Perceptron Mk1.5 加入影片物件追蹤,串接音訊理解與工具呼叫
新版可輸出帶時間戳的物件軌跡,將影音感知接上代理工具流程。功能已透過 API 與 SDK 提供,部署須留意音訊設定、輸出限制與舊模型遷移。

Perceptron 於 9 月 25 日發布 Mk1.5,將原生音訊理解、影片物件追蹤與工具呼叫加入感知模型,已透過平台 API 提供。模型接收文字、圖片、影片和音訊,輸出文字、座標點、框、多邊形及物件軌跡,可用於影片分析與具身代理。[官方公告](https://www.perceptron.inc/blog/introducing-perceptron-mk1-5)
技術重點是把物件的空間位置串成時間序列。SDK 的 `result.tracks` 包含物件標記、媒體索引與帶時間戳的觀測點;多份影像或影片則以 `asset_idx` 區分。對貨架盤點或運動影片,軌跡可連結同一目標在不同時間的位置,讓下游程式處理移動與事件順序。從工程角度看,這有機會減少逐幀偵測後另接物件關聯流程的工作,但遮擋後能否維持身分,仍應以實際素材驗證。[SDK 說明](https://pypi.org/project/perceptron/0.4.0/)
音訊支援也有明確邊界。更新紀錄列出每段最多 16,384 個音訊 token,約 21.8 分鐘,且會占用與其他輸入共用的 36,864-token 上下文。影片音軌預設不處理,須明確啟用 `vision_config.enable_audio_in_video`;僅上傳有聲影片,並不代表模型會同時分析聲音。[更新紀錄](https://docs.perceptron.inc/perceptron-mk1.5/changelog)
工具整合採應用程式執行函式、再回傳結果的多輪流程。模型卡規定,同一請求不能同時宣告工具與 JSON Schema 或正規表示式輸出限制,因此需要固定格式結果的代理,應在工具迴圈結束後另請求最終答案。應用端也須檢查 `finish_reason`,避免把因長度上限截斷的回覆當成完整結果。[模型卡](https://docs.perceptron.inc/perceptron-mk1.5/models/perceptron-mk1.5)
效能方面,官方報告相較 Mk1,端到端完成速度最高達 4.7 倍;測試使用單張 H100、取三次執行中位數,涵蓋聊天、圖片問答及影片負載。這是廠商自測,不能直接套用至不同解析度、併發量與推理設定,也不足以推論機器人控制迴圈的即時性。團隊仍需量測網路、工具執行與長影片帶來的尾端延遲。[測試條件](https://www.perceptron.inc/blog/introducing-perceptron-mk1-5)
導入須使用 Python 3.10 以上與 SDK 0.4.0 以上。既有部署還要留意:官方已於同日停用 Perceptron API 的三個 Isaac 0.1/0.2 模型識別碼,呼叫會回傳 404。遷移後應重新驗證追蹤品質、音訊用量及工具成功率,不能只確認 API 能連通。[套件需求](https://pypi.org/project/perceptron/0.4.0/)、[遷移公告](https://docs.perceptron.inc/perceptron-mk1.5/changelog)