羞羞视频亚洲-校园春色av-免费的黄色av-精品乱码久久久久久中文字幕-欧美体内she精高潮-欧美hdse-免费看的黄色小视频-日韩无-国产原创91-高清国产午夜精品久久久久久

星空xingkong.com官方網(wǎng)站-中國信通院啟動“方升”智能體基準測試任務(wù)征集工作 發(fā)布時間:2026-09-11

  【星空xingkong.com官方網(wǎng)站科技消息】9月7日,中國信息通信研究院(以下簡稱“中國信通院”)正式啟動“方升”智能體基準測試任務(wù)征集工作。此次征集旨在匯聚高質(zhì)量任務(wù)資源,進一步完善智能體測試任務(wù)、測試環(huán)境和評價方法。

AI示意圖AI示意圖

  中國信通院“方升”智能體基準圍繞基礎(chǔ)能力、典型場景和復(fù)雜綜合任務(wù)三大維度構(gòu)建分層測試框架。這一設(shè)計旨在推動智能體測試從傳統(tǒng)的“能說會道”式評估,向綜合能力測量、過程分析和問題診斷等更深層次拓展。隨著AI智能體從“回答問題”走向“執(zhí)行任務(wù)”,傳統(tǒng)的單一維度測試已難以全面衡量其真實能力,分層測試框架的建立正當其時。

  “方升”并非全新品牌。作為中國信通院聯(lián)合多家頭部大模型企業(yè)、用戶單位和科研機構(gòu)共同制定的評測體系,“方升”此前主要聚焦于大模型基準測試。2025年10月,中國信通院已發(fā)布“方升”3.0大模型基準測試體系,對國內(nèi)外141個大模型、7個智能體進行了測試,公布了大語言模型基礎(chǔ)能力、復(fù)雜推理能力、代碼能力等多維度結(jié)果。此次啟動智能體基準測試任務(wù)征集,標志著“方升”體系正從大模型評測向智能體評測延伸。

AIAI

  為進一步增強基準的專業(yè)性、代表性和產(chǎn)業(yè)適用性,中國信通院現(xiàn)面向社會公開征集測試任務(wù)。這一舉措意味著,無論是科研機構(gòu)、企業(yè)開發(fā)者還是個人開發(fā)者,均可參與“方升”智能體基準測試任務(wù)的建設(shè),共同推動智能體評估標準的發(fā)展與完善。

  在智能體技術(shù)快速迭代、應(yīng)用場景不斷拓展的當下,中國信通院“方升”智能體基準測試任務(wù)征集工作的啟動,將為行業(yè)提供一個更加科學(xué)、全面的評估體系,推動智能體從“能說會道”走向“能干實事”。

-星空xingkong.com官方網(wǎng)站