产品 +

iEnter|智慧企业 +

企业资源计划管理系统

智钉

iManu|智能制造 +

制造执行系统

物流执行系统

高级计划及排程

iSupply|智慧供应链 +

运输管理系统

仓储管理系统

供应商关系管理系统

EP|智慧生态营销 +

经销商管理系统

全面营销管理系统

客户关系管理系统

Connect|智能网联 +

智能网联云平台

新能源汽车监控平台

商用车企业监控平台

电检系统

行驶记录仪

车载T-BOX

汽车故障诊断仪

国六OBD产品

后装GPS产品

DataValue|数据价值赋能 +

智慧质量

线索运营

智慧广告

Platform|云原生PaaS平台 +

云原生PaaS平台

容器引擎(QKP)

AI智能服务平台

API网关平台

低代码平台-QLCP

元宇宙技术探索平台

数据中台

智能运维平台

服务 +

咨询 +

车路协同解决方案

IT咨询

云原生技术架构规划与咨询服务

评测 +

网络安全等级保护测评

实施 +

电子电气检测服务

网联产品组装制造

运维 +

桌面及外围设备运维服务

云服务(IDC)

销贷服务

乘用车车联网运营服务

商用车车联网运营服务

客户联络中心运营服务

数据价值运营服务

K8s运维

关于BBIN·宝盈 +

企业简介 +

企业简介

BBIN·宝盈行业地位 +

BBIN·宝盈企业荣誉

BBIN·宝盈行业地位

BBIN·宝盈资质认证

社会责任 +
企业文化 +
投资者关系 +
BBIN·宝盈麾下企业 +
加入BBIN·宝盈 +

BBIN·宝盈业务发展规划

BBIN·宝盈福利待遇

人才招聘

信息公开 +

企业基本信息 +

企业概况

经营范围

市场主体登记基本信息

组织机构

成员单位

资质荣誉

企业重大事项 +

股权信息

产权信息

研发成果

企业经营管理 +

财务与经营状况

品牌与产品

安全环保 +

安全信息

招标招募 +

招标信息

人力资源 +

招聘信息

社会责任 +
企业公告 +

上市公司

公告信息

投资者关系

加入BBIN·宝盈

客户留言

BBIN·宝盈-阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式
2026-07-10 19:29:21

  导语:7月8日,国际AI顶级学术集会ACL 2026宣布了最好论文奖项,阿里研究团队于Deep Research Agent标的目的的研究结果从全世界一万多篇投稿中脱颖而出

7月8日,国际AI顶级学术集会ACL 2026宣布了最好论文奖项,阿里研究团队于Deep Research Agent标的目的的研究结果从全世界一万多篇投稿中脱颖而出,获评最好资源论文奖(Best Resource Paper),是海内独一得到该奖项的中国公司。据悉,该论文初次体系展现了当前Agent于真实世界繁杂法则推理中面对巨年夜缺陷,并提出了全新的专家Agent评测基准,为晋升年夜模子于真实场景的靠得住性指了然新标的目的。

阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式

ACL(国际计较语言学协会)建立在1962年,是天然语言处置惩罚及计较语言学范畴中汗青最悠长、最具权势巨子性的国际学术构造。于学术评价系统中,ACL持久位居google学术计较语言学子范畴的h5-index影响力榜首,是年夜模子、Agent等前沿计技能的焦点论文首发阵地。据先容,ACL 2026共收到12148篇投稿,仅19%被主会任命,终极仅有4篇论文获评Best Resource Paper。

阿里这次获奖的论文以商品出口所需的10位海关编码(HS Code)为切入点,提出了针对于真实场景及专家程度的智能体新基准 HSCodeComp,它要求 Agent像资深关务专家同样,将商品恍惚的属性与严酷的关税归类法则对于齐,为商品精准映照到10位细分编码。研究团队对于14个主流年夜模子及9个进步前辈 Agent框架举行了周全评测。测试成果显示,体现最佳的Agent体系正确率仅为45%摆布,远低在人类专家95%的正确率。更值患上留意的是,研究还有发明纯真堆更多推理时间(inference-time scaling)其实不能显著缩小这道鸿沟,这象征着这暗地里并不是 算力问题 ,而是Agent架构自己的布局性瓶颈。

该研究还有进一步展现了致使Agent体系缺陷的缘故原由:起首太长的推理链致使Agent于半途偏离准确路径,其次是范畴常识不足致使法则误用,末了因为推理幻觉造成Agent天生缺少事实依据的分类判定。这些发明为Agent能力晋升指了然标的目的。

阿里斩获国际AI顶会最佳资源论文奖,提出Agent评测新范式

于 HSCodeComp基准测试中,阿里设计的Agent正确率到达65.0%

今朝,HSCodeComp基准的数据集与评测代码已经于Hugging Face及 GitHub周全开源。据先容,阿里已经基在该研究结果,于跨境商业数字关务等场景中设计了以Qwen基座模子为焦点的Agent框架,于HSCodeComp 基准(10 位编码正确率)上的测试成果显示,该Agent以65.0%的正确率稳居AI体系第一名。

ACL评审委员会暗示:“该基准切中了Agent运用的高度主要挑战——考查Agent对于严酷层级化天然语言法则的遵照能力,研究念头极具说服力;严谨的人类专家评测流程提供了高度靠得住的能力上界。”

阿里研究团队暗示: 层级法则运用是实际世界中年夜量专业决议计划的焦点能力,不仅存于在国际商业,也广泛存于在法令合规、医疗诊断、税务审计等主要高价值垂类范畴。HSCodeComp展现了当前Agent的能力界限,也为构建真正靠得住的专业AI体系提供了科学的评测标杆。

-BBIN·宝盈


地址:长春净月高新技术产业开发区百合街1009号

版权所有:BBIN·宝盈信息技术股份有限公司

电话:0431-85861717/ 4001182299