返回首頁

代理工具

Strands 推出通用代理執行框架,結合上下文卸載與提示快取

Strands harness 將工具、記憶與上下文管理組成可直接部署的代理,並提供 Python 與 TypeScript 介面。官方公布成本比較,但實際效益仍取決於任務、模型及快取條件。

Lincolnshire County Council, Adam Daubney, 2013-05-23 10:35:40 · CC BY-SA 2.0 · Image source
zh-Hant

Strands 團隊於 9 月 21 日公開 Strands harness,把模型迴圈、工具、上下文管理與記憶功能組成可直接執行的通用代理。開發者可透過 Python 或 TypeScript 建立代理,接入多家模型服務或 Ollama,再部署至 Linux 容器環境;官方採 Apache 2.0 授權發布。[發布公告](https://strandsagents.com/blog/introducing-strands-harness/)、[套件說明](https://pypi.org/project/strands-harness/)

這次值得注意的是上下文預設策略。公告說明,大於約 1,500 token 的工具結果會被截短,上下文占用超過 85% 時觸發摘要壓縮,溢位時另有迴圈內恢復機制。文件進一步指出,大型結果會移至儲存空間,對話保留預覽與參照,讓代理需要時重新取回全文。工程上的關鍵是減少每輪重送的內容,同時保留回查入口。[預設策略](https://strandsagents.com/blog/introducing-strands-harness/)、[上下文管理文件](https://strandsagents.com/docs/user-guide/harness/configure/context-and-caching/)

快取則依供應商分工:對 Bedrock 與 Anthropic 直接介面,框架配置快取點及工具定義;部分其他服務採伺服器端自動快取。因此關閉框架的 `caching` 選項,只會停用它自行配置的部分,不能一概解讀為所有供應商都停止快取。自行傳入模型物件時,也須另外核對底層設定。[快取行為](https://strandsagents.com/docs/user-guide/harness/configure/context-and-caching/)

團隊以 EC2 與 Harbor 執行六項基準,宣稱使用相同 Claude 或 GPT 模型比較其他框架時,彙整 token 成本低 28%,分數接近或較佳。然而圖表註記也承認,DeepSeek Harness 的成本再低約 14%,但各項得分較低。28% 是這組比較的彙整結果,不能套用到每個任務;公告表示完整評測論文仍待後續發布。[評測說明](https://strandsagents.com/blog/introducing-strands-harness/)、[圖表註記](https://strandsagents.com/embeds/strands-harness-benchmarks.html)

部署端也有具體差異:工作階段與長期記憶預設寫入本機 `.agent` 目錄,使用暫存磁碟的容器需要持久化儲存。官方另提醒,程式化工具呼叫使用的 Monty 隔離模型撰寫的程式,並不連帶隔離被呼叫工具的權限;內建 shell 與檔案修改能力仍須配置沙箱及操作政策。[正式環境部署文件](https://strandsagents.com/docs/user-guide/harness/production/)

對團隊而言,這提供了一組可覆寫、可比較的代理預設值。下一步應固定模型與框架版本,在自己的長任務上一起量測完成率、總費用及延遲,特別檢查摘要是否遺失約束、卸載內容是否能成功取回,以及容器重啟後能否恢復工作階段。評測也應保留工具輸出長度、快取命中與重試紀錄,才能分辨成本下降來自內容縮減、重複輸入折扣,或任務執行方式改變。

來源

  1. Introducing Strands harness: frontier performance with 28% lower token cost
  2. strands-harness
  3. Manage context and caching
  4. Strands harness benchmark cost comparison
  5. Take Strands harness to production