![]() |
新產品同時驗證與客戶互動及在系統中執行操作的 AI 智能體,直接從程式碼產生測試情境,根據實際證據評核每項操作,並將所有未能驗證的部分量化為「驗證缺口」
三藩市及印度諾伊達2026年8月19日 /美通社/ -- 全球首個 Agentic AI 原生品質工程平台 TestMu AI(前稱 LambdaTest)今日宣佈推出 Agent Assurance,旨在回答所有準備將 AI 智能體上線的工程團隊都要面對的一個問題:這個智能體是否已達到安全上線的要求?Agent Assurance 以單一產品涵蓋兩類智能體:對話式智能體類別可評估透過聊天、語音、電話、視像及圖像與人互動的智能體;全新的自主智能體類別則驗證在系統中執行操作的智能體:包括調用工具、寫入檔案、呼叫 API 及建立 pull request。
目前,大多數團隊在測試自主智能體時,只會參考智能體對自身行動的描述:文字記錄,或評審器根據其最終訊息給出的評分。Agent Assurance 則評核智能體實際造成的結果。只要連接至程式碼庫,Agent Assurance 便會分析智能體的功能,產生一套端到端智能體測試套件,涵蓋功能測試、非功能檢查及對抗性情境。系統會實際調用智能體,並根據觀察所得的證據評核每項準則。相關證據包括:磁碟上實際被修改的檔案、所產生的成果檔案,以及按照智能體自行聲明的可用工具範圍核實的工具調用記錄。
除了「通過」和「不通過」外,Agent Assurance 還會作出第三種判定——無法驗證。這類結果不會計入通過率,而會另行量化為:驗證缺口。報告中的每項結果均建基於實際觀察所得的證據。由於驗證缺口反映智能體對自身行動的記錄完整程度,團隊可透過提高智能體的可觀察性,逐步收窄該缺口。
「工程團隊目前正於風險最高的環節累積驗證債務。智能體對自身行為的描述,是判斷其實際行為時最薄弱的證據——因為在所有相關方之中,它本身最有可能作出錯誤陳述。」TestMu AI 集團工程高級副總裁 Vipul Verma 表示。「這個領域的每項工具都會報告通過率。Agent Assurance 不但報告通過率,亦會顯示自身盲點有多大。唯有同時交代盲點,團隊才能信賴這個數字,並據此決定是否推進發佈。」
藉助 Agent Assurance,團隊可以:
對話式智能體類別亦正擴展至軟件與人互動的最新介面:出現在鏡頭前的智能體。透過平台全新的 Video Agent Testing(Link)功能,一名擁有逼真面容及聲音的模擬真人會加入視像智能體的即時會話,與其進行自然對話,並按照團隊自訂的成功準則評核智能體。每項判定均可追溯至錄影中支持該判定的確切時刻。任何無法從錄影中核實的項目,均會被明確判定為未達標。對這個以錄影作為證據的類別而言,這是一項嚴格標準:凡評估者未能觀察到的表現,視像智能體一律不獲計分。
對話式智能體類別現已於 TestMu AI 平台正式推出。自主智能體類別現以搶先體驗形式開放,並可透過終端機以 rook 運行。模型會在 TestMu AI 控制器中執行,因此本機毋須配置供應商的 API 金鑰。如欲開始使用,請瀏覽 Link。
TestMu AI 簡介
TestMu AI 是全球首個 Agentic AI 原生品質工程平台,旨在以智能技術為核心,協助機構實現測試自動化並擴展測試規模。TestMu AI 結合自主運作能力,並與現代開發工作流程無縫整合,協助團隊在 AI 優先的世界中,更快交付更可靠、更安全的軟件。
如欲了解更多資訊,請瀏覽 TestMu AI





Contact Us
Notice