你的位置:开云(中国)kaiyun网页版登录入口 > 资讯 > 开云体育但不同智能体之间缺少一致的测试经过和可比的性能基准-开云(中国)kaiyun网页版登录入口
开云体育但不同智能体之间缺少一致的测试经过和可比的性能基准-开云(中国)kaiyun网页版登录入口
发布日期:2026-08-06 07:30    点击次数:93

开云体育但不同智能体之间缺少一致的测试经过和可比的性能基准-开云(中国)kaiyun网页版登录入口

2026年7月开云体育,海外电信定约电信模范化部家世21究诘组(ITU-T SG21)全会在瑞士日内瓦召开。中国信息通讯究诘院围绕大模子评估、智能体评估、智能化软件工程、寰球模子、东谈主工智能原生讹诈平台等重心鸿沟共取得10项模范化效果,握续完善东谈主工智能海外模范体系布局。

2项大模子鸿沟海外模范发布出书。本次全会审议通过了2026年5月第三责任组(WP3)中间会议申诉,阐明了干系课题组的责任进展。中国信通院牵头的2项大模子鸿沟海外模范依据ITU-T AAP要领取得批准,当今已由海外电联细腻发布出书。

● ITU-T F.748.69(ex F.FMD)General technical framework and requirements of foundation model for mobile device/ 面向挪动末端的大模子通用时期框架和条目

大模子正在向手机、平板、机器东谈主等末端设备加快渗入,但端侧算力不及、集结不厚实、功耗敏锐等敛迹使得云表大模子决议难以顺利复用,亟需针对末端场景制定专用时期表率。该模范规定了末端大模子的总体框架、模子智力条目、模子适配要乞降模子处事条目,为端侧大模子的研发、评估和部署提供指引。

●ITU-T F.748.74(ex F.RFE-MM)Requirements and framework for evaluation of multimodal foundation models/ 多模态基础模子评估条目与框架

多模态基础模子交融文本、图像、音视频等多种模态智力快速迭代,但各厂商评测口径不长入,跨模态任务缺少可比的评估基准,制约了模子的确凿选型和握续改换。该模范拓荒了多模态基础模子评估框架,规定了测试场景、数据集、器具与经过,并围绕感知、融会、生成、检索、推理等中枢智力给出可量化评估法式。

智能体互操作模范、寰球模子时期申诉获全会批准。本次全会对中国信通院牵头的1项智能体鸿沟海外模范和1项寰球模子鸿沟时期申诉进行了审议,分离批准结项和通过,两项效果将参预发布要领。

●ITU-T F.748.93(ex F.AAI)Framework and Requirements for AI Agent Interoperability/ 智能体互操作性时期条目

现时智能体濒临集成资本高、跨系统互联存在壁垒等挑战,业界亟需模范表率智能体的互操作机制和讹诈层交互。该模范涵盖互操作基础身分、互操作与交互、互操作讹诈三个部分,其中:互操作基础身分明确了智能体互联协同过程中各类基础数据和信息单位,互操作与交互明确了智能体的互操作经过与交互机制,互操作讹诈明确了智能体互联协同过程中的讹诈管制与讹诈保险。

●ITU-T FSTR.WM Technical framework and essential capabilities of World Models/ 寰球模子时期框架及弱点智力时期申诉

寰球模子算作物理寰球融会和展望的中枢模块,在自动驾驶、机器东谈主等鸿沟展现出显耀后劲,但当时期阶梯和智力领域尚缺少系统梳理。该时期申诉给出寰球模子的界说、发扬时期架构与最新进展、归纳弱点智力,并分析典型讹诈场景,为后续究诘和模范化责任提供了膺惩参考。

智能体、智能化软件工程等地方6项新名堂奏凯立项。本次全会还批准了中国信通院牵头的3项新海外模范和3项新时期申诉立项,掩饰智能体评估、智能体分类分级、智能体基础设施、智能化开发与运维器具、东谈主工智能原生讹诈平台等地方。

●ITU-T F.ACAIA-B Assessment criteria for artificial intelligence agents: Benchmark/ 智能体评估模范:基准测试

智能体在各行业加快部署,但不同智能体之间缺少一致的测试经过和可比的性能基准,难以客不雅评判智能体的骨子智力。该模范拟规定智能体基准测试框架,包括测试环境、数据集和器具等基准条目,以及通用智力与任务性能的评估范围,为以可复现、可比拟的阵势评估智能体提供模范化法式。

●ITU-T F.EM-IDT Evaluation Methods and Metrics of Intelligent Development Tools for Multimedia Applications/ 智能开发器具评价法式与办法

智能开发、智能测试等软件研发器具快速知晓,但不同器具遴荐的智能化智力办法计较法式各异明显,导致评估斥逐缺少横向可比性。该模范以软件工程全生命周期为干线,掩饰需求分析与策画、开发、测试、运维四大阶段,系统构建各阶段智能化智力的度量办法体系与评估法式,对数据起原、办法计较法则等中枢内容作出长入界定,为软件工程全生命周期智能化智力的表率评价与握续普及提供时期复古。

●ITU-T F.IOMT Technical Requirements of Intelligent Operation and Maintenance Tools for Multimedia Applications/ 智能化运维器具的时期条目

智能运维器具正向根因研判、协同措置和故障收复等闭环自治演进,然而不同器具的智力领域和评价条目尚不长入。本模范面向智能运维全经过,围绕自主运维、故障反映、运维协同、常识管制四个中枢智力域,规定相称检测、告警分析、根因识别、故障收复、常识问答等11类场景的时期条目,为智能运维器具的研发策画、采购选型和验收讹诈提供长入依据。

● ITU-T FSTR.CMCLAIA Classification methods and capability level requirements for AI agents/ 智能体分类法式与智力品级条目时期申诉

智能体居品形态日趋各类,但功能分类和智力分级尚无长入模范,企业和用户难以快速判断居品定位和智力水平。该时期申诉拟拓荒智能体分类法式与智力品级条目框架,分类法式掩饰时期维度与讹诈维度,智力品级涵盖时期智力、讹诈见效与脱手保险,为居品选型和智力评估提供参照。

● ITU-T TR.AAI Technical report for guidance on the technical framework of AI Agent Infrastructure/ 智能体基础设施时期框架时期申诉

智能体讹诈已从单轮问答扩张到任务计算、器具调用、多智能体协同等复杂场景,但底层基础设施在记挂管制、器具编排、权限限度、脱手监测等方面缺少长入架构参考。该时期申诉究诘智能体基础设施的框架、弱点智力和功能条目,掩饰脱手环境、记挂系统、智力接入和运维管制等,为智能体讹诈的研发、部署与脱手提供长入参考。

●ITU-T FSTR.AINAP Analysis of artificial intelligence native application platforms/ 东谈主工智能原生讹诈平台时期申诉

现时,东谈主工智能原生讹诈平台参预快速发延期,但此类平台存在器具链不熟谙、多模态支握不及等挑战,国表里尚未造成干系的时期申诉,存在明显究诘空缺。为指令产业有序发展、表率行业自律、为用户提供科学选型参考,该时期申诉聚焦面向多媒体讹诈的东谈主工智能原生讹诈平台,从平台配景、宗旨、讹诈开发、讹诈分发和平台熟谙度伸开系统性究诘,旨在普及干系宗旨的海外影响力。

著作起原:中国信息通讯究诘院

-END-

WAIC 透视:Token 经济时期电信运营商的发展旅途

WAIC 不雅察:对于AI,中国联通后晰传递三大产业信号

WAIC 2026|中国工程院院士王坚:基础模子是AI赋能基础科学的全新悠扬点

责编/版式:孙 天

审校:梅雅鑫

监制:刘启诚

【媒体矩阵】

当天头条 | 微博 | 微软MSN | 百家号

网易号 | 东谈主民号 | 腾讯新闻 | 搜狐

新浪看点 | 雪球号 | 知乎

【运营团队】

剪辑|梅雅鑫 孙天 朱文凤

审校 | 梅雅鑫

监制|刘启诚开云体育



相关资讯