
导语:7月8日,国际AI顶级学术集会ACL 2026宣布了最好论文奖项,阿里研究团队于Deep Research Agent标的目的的研究结果从全世界一万多篇投稿中脱颖而出 7月8日,国际AI顶级学术集会ACL 2026宣布了最好论文奖项,阿里研究团队于Deep Research Agent标的目的的研究结果从全世界一万多篇投稿中脱颖而出,获评最好资源论文奖(Best Resource Paper),是海内独一得到该奖项的中国公司。据悉,该论文初次体系展现了当前Agent于真实世界繁杂法则推理中面对巨年夜缺陷,并提出了全新的专家Agent评测基准,为晋升年夜模子于真实场景的靠得住性指了然新标的目的。 ACL(国际计较语言学协会)建立在1962年,是天然语言处置惩罚及计较语言学范畴中汗青最悠长、最具权势巨子性的国际学术构造。于学术评价系统中,ACL持久位居google学术计较语言学子范畴的h5-index影响力榜首,是年夜模子、Agent等前沿计技能的焦点论文首发阵地。据先容,ACL 2026共收到12148篇投稿,仅19%被主会任命,终极仅有4篇论文获评Best Resource Paper。 阿里这次获奖的论文以商品出口所需的10位海关编码(HS Code)为切入点,提出了针对于真实场景及专家程度的智能体新基准 HSCodeComp,它要求 Agent像资深关务专家同样,将商品恍惚的属性与严酷的关税归类法则对于齐,为商品精准映照到10位细分编码。研究团队对于14个主流年夜模子及9个进步前辈 Agent框架举行了周全评测。测试成果显示,体现最佳的Agent体系正确率仅为45%摆布,远低在人类专家95%的正确率。更值患上留意的是,研究还有发明纯真堆更多推理时间(inference-time scaling)其实不能显著缩小这道鸿沟,这象征着这暗地里并不是 算力问题 ,而是Agent架构自己的布局性瓶颈。 该研究还有进一步展现了致使Agent体系缺陷的缘故原由:起首太长的推理链致使Agent于半途偏离准确路径,其次是范畴常识不足致使法则误用,末了因为推理幻觉造成Agent天生缺少事实依据的分类判定。这些发明为Agent能力晋升指了然标的目的。 于 HSCodeComp基准测试中,阿里设计的Agent正确率到达65.0% 今朝,HSCodeComp基准的数据集与评测代码已经于Hugging Face及 GitHub周全开源。据先容,阿里已经基在该研究结果,于跨境商业数字关务等场景中设计了以Qwen基座模子为焦点的Agent框架,于HSCodeComp 基准(10 位编码正确率)上的测试成果显示,该Agent以65.0%的正确率稳居AI体系第一名。 ACL评审委员会暗示:“该基准切中了Agent运用的高度主要挑战——考查Agent对于严酷层级化天然语言法则的遵照能力,研究念头极具说服力;严谨的人类专家评测流程提供了高度靠得住的能力上界。” 阿里研究团队暗示: 层级法则运用是实际世界中年夜量专业决议计划的焦点能力,不仅存于在国际商业,也广泛存于在法令合规、医疗诊断、税务审计等主要高价值垂类范畴。HSCodeComp展现了当前Agent的能力界限,也为构建真正靠得住的专业AI体系提供了科学的评测标杆。 
