首页

首页
当前位置 : 当前位置: 首页 > 正文
人工智能学院15篇论文被AAAI 2026录用

发布:2025-11-11来源:人工智能学院


近日,AAAI 2026AAAI Conference on Artificial Intelligence)公布了论文录用结果,人工智能学院15篇论文被录用第一作者分别是高子涵博士生(导师:焦李成教授),王佳豪博士生(导师:刘芳教授),孙琦博士生(导师:侯彪教授,联合指导老师:曹震副教授),翟惠良博士生、莫世冰博士生(导师:刘静教授),顾浩然博士生(导师:王晗丁教授),杨智超博士生、盛祥非博士生(导师:李雷达教授),王懿婧博士生(导师:唐旭教授),刘旭副教授,胡宸瑜本科生(指导老师:朱浩副教授、李晓童博士),张旭博士(通讯作者)及李颖萍博士(合作导师:水平教授)。其中,王佳豪、翟惠良、杨智超、王懿婧等四人的论文被选为oral(口头报告)论文


AAAI Conference on Artificial Intelligence是人工智能领域历史悠久、学术影响力广泛的顶级国际会议之一,聚焦智能体、知识表示、机器学习、自然语言处理、计算机视觉等方向的前沿研究,同时也是CCF A类国际学术会议。AAAI 2026将于1月20日-27日在新加坡举办。今年共有23680篇论文投稿,最终4167篇论文接收,录用率17.6%,其中被遴选为Oral Presentation的比例通常低于5%

录用论文简要介绍如下:

论文一

论文题目:Evolving Semantic Propagation for Aerial Semantic 3D Gaussian Splatting

论文作者:高子涵,李玲玲,刘旭,刘芳,焦李成,陈璞花,马文萍,杨淑媛

论文概述:

航拍场景的三维语义理解在城市规划、自动导航等领域具有重要性,3D Gaussian Splatting3DGS)虽在航拍场景重建中取得突破,但如何为重建航拍场景赋予精准语义信息仍是核心挑战。现有方法主要分为两类:一类从CLIP蒸馏特征迁移至3DGS,另一类通过2D标注直接监督语义分割。这些方法在自然场景表现出色,但应用于航拍场景时暴露明显短板——前者因视角域差距和CLIP粗粒度特征难以精准分割,后者需海量标注、成本高昂且难以规模化。本文的核心洞察在于,航拍场景虽规模庞大,却包含大量高度重复的结构特征,建筑、道路、植被等元素在不同区域保持一致的视觉属性,这为语义信息的高效传播提供了可能。基于这一洞察,本文提出EvoPropGS框架,首先利用SAMDINOv2,从稀疏标注视角构建视觉提示库;随后通过演化算法,在同时度量三维高斯语义一致性与多视角二维掩膜重叠质量的混合3D-2D适应度函数引导下搜索最优提示组合,最终将语义信息精准传播至未标注区域。

实验结果表明,该框架仅需2%的像素标注,即可达到与密集监督方法相当的性能,为航拍场景的3D高斯语义理解提供了兼具实用性与高效性的解决方案。

论文二

论文题目:HTTrack: Learning to Perceive Targets via Historical Trajectories in Satellite Video Tracking

论文作者:王佳豪,刘芳,焦李成,王浩,李硕,王昕怡,李玲玲,陈璞花,刘旭

论文概述:

近年来,深度学习的快速发展推动了卫星视频跟踪领域的显著进步,这一技术在环境监测、灾害管理和国防等应用中至关重要。尽管取得了这些进展,现有方法仍受限于无法应对动态挑战,例如目标外观变化、复杂运动模式和遮挡问题。传统方法往往存在静态模板匹配或更新机制过于复杂的缺陷,这影响了它们在实际场景中的鲁棒性和实用性。为解决这些局限性,文章提出在卫星视频跟踪中进行范式转变,将历史轨迹知识与视觉特征相结合。这种融合增强了跟踪器对目标随时间变化的感知理解能力,实现了更具适应性和韧性的跟踪。通过对齐空间、时间和跨模态信息,本文的方法有效弥合了碎片化观测与连贯跟踪性能之间的差距,即使在小目标检测和背景杂乱等具有挑战性的条件下也能表现良好。

论文三

论文题目:Semantic Feature Purification for Adversarially-Aware RGB-T Tracking

论文作者:王佳豪,刘芳,王浩,李硕,王昕怡,陈璞花

论文概述:

RGB-T跟踪技术正日益应用于自动驾驶、监控和救援机器人等安全关键型应用中,在这些应用中,恶劣条件下的跟踪可靠性至关重要。尽管RGB与热红外模态的融合在低光照和遮挡场景下提高了鲁棒性,但近期研究发现,RGB-T跟踪器仍然极易受到细微输入扰动的影响,这种人类难以察觉的修改会利用跨模态不一致性来误导跟踪输出。在现实场景中,此类扰动可能源于传感器欺骗、红外伪装或物理世界攻击,对运行安全构成严重威胁。为解决这一问题,论文提出了SFPT,一种在表征层面增强RGB-T跟踪性能的语义特征净化框架。SFPT并非在像素层面过滤受损输入,而是在特征空间中引入特定任务的语义锚点,以强化对扰动不敏感的线索。这些锚点源自描述性语,通过与视觉特征交互来净化表征。为进一步抑制模态特异性干扰,本文设计了自适应扰动引导跨模态融合(APG-CMF)模块,该模块利用语言和视觉信号估计可靠性,并动态重新加权跨模态特征,确保在扰动条件下实现稳健融合。在多种扰动条件下进行的大量实验验证了方法的有效性。

论文四

论文题目:Optimization Method for Surrogate Function in Spiking Neural Networks Based on Membrane Potential Distribution

论文作者:孙琦,曹震,耿凯鸽,张紫艺,侯彪

论文概述: 

脉冲神经网络(SNN)在边缘智能领域展现出优异的能量效率和时间稀疏性,但由于梯度失配、膜电位漂移和离散化误差等问题,其训练仍然面临挑战。本研究创新提出了一种基于膜电位的代理优化(MPO)框架,该框架动态地将代理函数与膜电位分布对齐,从而增强梯度传播。具体而言,本研究引入了一种基于KL散度的正则化方法来稳定膜电位动态,并引入了一种自适应宽度约束来使代理梯度范围与神经活动统计同步。此外,本研究还设计了一种脉冲离散化误差度量和一种校正策略来缓解时间离散化的影响。在多个数据集上的实验表明,本研究的方法分别达到了较高top-1准确率,同时提高了梯度稳定性和能量效率。这项工作为实际神经形态系统中鲁棒且可扩展的SNN训练提供了一种有原则的优化方案。

论文五

论文题目:SFGA: Similarity-Constrained Fusion Learning for Unsupervised Anomaly Detection in Multiplex Graphs

论文作者:翟惠良,滕祥意,刘静

论文概述:

多层网络被广泛用于建模现实世界中的大规模复杂系统,并在互联网金融、电子商务等多个实际场景中发挥重要作用。因此,在多层网络中检测异常样本对于确保网络安全和系统稳定至关重要。现有的图异常检测方法主要面临以下两个挑战:1.由于多层网络中关系的多样性和复杂性,传统面向同质图的异常检测模型无法有效捕捉与多样化关系模式相关的异常行为;2.在实际应用中,恶意实体通常通过各种伪装策略隐藏自身,使得仅依靠单一关系分析的方法难以捕捉细微的异常特征。为应对这些挑战,文章提出了一种基于相似性约束的融合图自编码器Similarity-Constrained Fusion Graph Autoencoder)的无监督多层网络异常检测方法。具体而言,本文设计了一个多关系图自编码器,并在模型瓶颈处引入跨关系注意力模块,以实现对跨关系异常模式的全面建模。随后,提出相似性平衡策略,从局部和全局角度对瓶颈处的节点表示进行约束,增强自编码器对伪装性异常的区分能力,并能够更有效地识别具有重叠或欺骗性特征的异常节点。本文不同规模的合成数据集和真实数据集上进行了大量实验,结果表明本文方法在性能上相较现有最新方法取得了大幅提升。

论文六

论文题目Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention

论文作者:莫世冰,阮昊炀,吴凯,刘静

论文概述:

大型语言模型LLM展现出了卓越的泛化能力,但要使其输出符合人类偏好,通常需要昂贵的有监督微调。近年来,一些测试时方法尝试通过文本反馈来解决这一问题,但它们往往仅对单个候选响应进行批评与修订,缺乏一种系统化机制来分析、权衡并综合多个有潜力的候选响应的优点。这样的机制至关重要,因为不同的响应可能在不同方面表现出色(例如清晰度、事实准确性或语气),而结合它们的优势可能会产生质量更高的结果。本文提出了一种新的测试时偏好优化范式——文本自注意力网络(Textual Self-Attention Network, TSAN),该方法无需参数更新。TSAN 完全以自然语言的方式模拟自注意力机制,以弥补上述缺陷:它通过将多个候选响应格式化为文本形式的,利用基于LLM的注意力模块对其相关性进行加权分析,并在学习到的文本注意力引导下综合各自优势,从而生成一个新的、符合人类偏好的响应。整个过程在文本梯度空间中进行,实现了可迭代且可解释的优化。实验证明,仅需在一个基础的监督微调(Llama-3.1-70B-SFT)模型上进行三次测试时迭代,TSAN的性能便超越了如Llama-3.1-70B-Instruct等有监督模型。在实际部署场景中,TSAN能直接插入Qwen-3-Plus等商用模型,在多个基准测试均显著提升了已对齐和未对齐模型的性能。同时在西安电子科技大学广州研究院的本地服务器上部署gpt-oss 20B模型+TSAN”的组合,性能与gpt-oss 120B模型相当,且计算开销适中(每次查询约11.8 PFLOPs),这对于资源受限环境下的部署极为有利。

论文七

论文题目:ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models using Pareto High-quality Data

论文作者:顾浩然,王晗丁,梅一,张孟杰,金耀初

论文概述:

将大语言模型(LLM)与多样化的人类期望和价值观对齐,对于确保模型能够充分满足不同用户需求至关重要。为此,如MODPORiC等离线多目标对齐算法在性能和效率方面展现出良好权衡。然而,不恰当的偏好表示以及使用不平衡的奖励分数训练限制了此类算法性能的进一步提升。在本研究中,提出了一种新的LLM离线多目标对齐算法,即ParetoHqD,来解决上述问题。该方法将人类偏好表示为奖励目标空间中的偏好方向,并将靠近Pareto前沿的微调数据视为高质量数据。对于每个人类偏好,ParetoHqD采用两阶段的监督微调训练流程,其中每个阶段都使用一个与该偏好方向最匹配的Pareto高质量训练集。在两个多目标对齐任务上的实验结果表明,ParetoHqD的性能优于五种最先进的基线算法。

论文八

论文题目:LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

论文作者:杨智超,顾天骄,王建杰,林飞宇,盛祥非,陈鹏飞,李雷达

论文概述:

长文本到图像(LongT2I)生成技术的迅猛发展,催生了对自动化且具可解释性的评估模型的迫切需求,以衡量在长提示场景下的图文对齐质量。然而,现有的T2I对齐评估基准主要局限于短提示场景,仅提供平均意见得分(MOS)或李克特量表标注,这一内在局限性严重阻碍了长文本生成图像评估器的发展,尤其是在对齐可解释性方面。本研究中,建立了LongT2IBench,这是一个包含14,000个长文本-图像对的基准数据集,并配备细粒度的图结构化人工标注。针对长提示所具有的细节密集特性,创新性地设计了“Generate-Refine-Qualify”标注协议,将复杂的长提示转化为包含实体、属性及关系的结构化图表示。通过这种转换,实现了基于细粒度元素的精确图文对齐标注。这些标注最终被转化为量化评分和结构化解释,为长T2I评估模型的设计奠定了坚实基础。基于LongT2IBench进一步提出了LongT2IExpert评估模型,该模型通过层次化对齐思维链(Hierarchical Alignment Chain-of-Thought)的指令微调,使多模态大语言模型(MLLMs)能够同时提供定量评分和结构化解释。大量实验与对比分析证明了LongT2IExpert的卓越性能,为长文本到图像生成的评估树立了新标准。

论文九

论文题目:Fine-grained Image Quality Assessment for Perceptual Image Restoration

论文作者:盛祥非,潘晓峰,杨智超,陈鹏飞,李雷达

论文概述:

近年来,图像恢复(IR)领域取得了显著的进展,这催生了对精确的图像质量评估(IQA)方法的迫切需求,因为IQA对于衡量算法性能和指导算法优化至关重要。然而,现有的IQA方法在IR任务中存在不足,尤其在分辨恢复图像之间的细粒度质量差异方面。为解决这一难题,本文提出了首个专为图像恢复设计的细粒度图像质量评估数据集FGRestore,其中包含六类常见IR任务下的18,408张恢复图像,除了传统的分数标注外,该数据集还包含30,886个细粒度的成对偏好标签。基于FGRestore文本对现有的IQA方法进行了全面的基准测试,结果显示现有的基于分数的IQA方法与人类感知之间存在显著偏差。受上述发现的启发,本文进一步提出了一个专为图像恢复设计的IQA模型FGResQ,该模型兼具粗粒度分数回归和细粒度质量排序能力。大量的实验表明,FGResQ的性能显著优于现有算法。

论文十

论文题目:TuningIQA: Fine-Grained Blind Image Quality Assessment for Livestreaming Camera Tuning

论文作者:盛祥非,段志超,潘晓峰,黄一珀,杨智超,陈鹏飞,李雷达

论文概述:

随着直播的普及,自动的相机画质调优对于提升用户体验质量(QoE)至关重要,这种调优需要准确的盲图像质量评估(BIQA)来指导参数优化决策。然而,现有BIQA模型通常只输出一个粗粒度的整体质量分数,无法为精细的相机参数调优提供指导。受上述事实启发,文章首先构建了一个专为直播相机调试设计的细粒度BIQA数据库 FGLive-10K,该数据库包含在多样化相机参数下采集的10,185张高分辨率图像,并附有50,925个多维度质量标注和19,234个细粒度标注。基于此数据库,进一步提出了一个面向直播相机调优的细粒度BIQA模型TuningIQA,该模型整合了人类感知特征提取和基于图神经网络的相机参数融合。实验证明,TuningIQA在质量分数回归和细粒度排序任务上均优于现有的BIQA方法,在部署用于直播相机调优时也表现出优异的性能。

论文十一

论文题目:ID-Splat: Propagating Object Identities for Segmenting 3D Aerial-view Scenes

论文作者:王懿婧,唐旭,张向荣,马晶晶

论文概述:

高分辨率遥感技术推动场景理解从二维向三维升级,但现有3D 航拍场景分割方法多依赖自然场景预训练的二维判别模型,通过知识蒸馏将语义嵌入3D Gaussian Splatting3DGS)表示。这类方法存在显著域偏差:航拍影像在视角、尺度及场景特性上与自然场景差异显著,导致判别模型难以精准识别航拍对象,进而限制分割性能。为突破这一瓶颈,本文提出对象中心化框架ID-Splat,其摆脱对外部判别语义先验的依赖,通过多视角对象ID直接驱动三维语义建模。ID-Splat包含两个核心阶段:首先,Mask-object Tracking融合SAMPoint Tracking,在多视图间建立鲁棒一致的对象ID,并通过边缘对象传播策略增强遮挡与边界区域的ID一致性;随后,Object Integration & Propagation将对象ID映射至3DGS点云,通过多参考语义传播策略在三维空间扩散语义标签,实现完整的场景语义覆盖。基于3D-AS数据集的大量实验表明,ID-Splat在稠密与极稀疏标注条件下均显著优于现有2D/3D开放词汇与3DGS分割方法,有效缓解了域偏差问题,同时显著降低了对人工标注的依赖,验证了基于对象ID的三维语义传播范式在航拍场景中的有效性与普适性。

论文十二

论文题目:SOAR: Semi-supervised Open-vocabulary Aerial Object Detection via Dual-Aware Enhanced Prior Denoising

论文作者:刘旭,黄宜泓, 张丹,李玲玲, 孙龙, 焦李成

论文概述:

开放词汇目标检测(Open Vocabulary Object Detection,OVOD)旨在识别未在训练集中出现的物体类别,在遥感领域目标识别方向具有极为重要的意义,但由于其独特价值,存在诸多挑战,如背景区域占主导地位、目标及标签稀疏、语义信息有限以及半监督训练困难等。为应对这些挑战,本文提出了具有双感知先验去噪的半监督开放词汇航空目标检测(SOAR)方法,该方法明确建模每个场景的背景嵌入,以间接构建前景先验,从而利用遥感影像中丰富的背景信息。本文进一步引入了一个查询增强模块,该模块整合语言信息和前景先验信息,以增强查询选择和特征增强的有效性。在半监督训练的解码阶段,本文对前景先验进行去噪和重建,以生成支持训练过程的伪标签。此外,本文通过扩展和聚合技术解决标签信息的稀疏性问题,进一步提升了模型识别性能。

论文十三

论文题目:Hierarchical Direction Perception via Atomic Dot-Product Operators for Rotation-Invariant Point Clouds Learning

论文作者:胡宸瑜,李晓童,朱浩,侯彪

论文概述:

3D云处理已成为许多视觉任务的基石技术,然而,任意旋转会引入点云方向的变化,破坏其固有的方向特征,这对有效的表示学习构成了长期挑战。现有的方法尝试隐式地建模旋转等变性和不变性,但往往难以充分利用点云的多尺度方向本质来增强特征表示。为解决这一问题,本文提出了方向感知向量网络(DiPVNet)。该网络的核心在于一种原子点积算子,它能够同时编码方向选择性和旋转不变性,从而赋予网络旋转对称性建模和自适应方向感知的能力。在局部层面,本文引入了可学习局部点积(L2DP)算子,使中心点与其邻域能够进行交互,以自适应地捕获点云的非均匀局部结构。在全局层面,本文利用广义谐波分析证明了点云与球面采样向量之间的点积等价于方向感知球面傅里叶变换(DASFT),并据此构建了全局方向响应谱以建模整体方向结构。本文在包含噪声和大角度旋转的挑战性场景下进行了广泛实验,结果表明DiPVNet在点云分类和分割任务上均达到了最先进的性能。

论文十四

论文题目:Personalized Federated Learning with Bidirectional Communication Compression via One-Bit Random Sketching

论文作者:张旭及合作者

论文概述:

联邦学习支持去中心化数据的协同训练,但面临双向通信开销过大与客户端数据异质性两大核心挑战。为解决这些问题,本文提出一种新型个性化联邦学习框架pFed1BS,通过单比特随机投影技术实现极致通信压缩。具体而言,客户端传输本地模型参数的单比特随机投影,服务器将这些随机投影聚合为全局单比特共识向量并广播至所有客户端。针对数据异质性问题,本文在目标函数中引入基于单边l1范数的符号正则项,引导个性化模型优化。这样既与全局共识保持一致,又保留本地数据特性。为降低随机投影的计算开销,本文采用快速哈达变换作为高效投影机制,使计算复杂度与模型参数维度呈近线性关系。理论分析证明,该算法可收敛至全局优势函数的一阶稳定点的邻域。数值仿真结果表明,与不使用通信压缩的FedAvg算法相比,pFed1BS以不到其百分之一的通信量达到了不错的性能;与其他单比特联邦学习算法相比,pFed1BS在大幅降低通信成本的同时实现了最好的性能。

论文十五

论文题目:TIM++: Transductive Information Maximization for Few-Shot CLIP

论文作者:李颖萍,邹雨彤,黄韵诗,焦昶哲,王新林,彭深,郭璋,水平

论文概述:

Transductive Information MaximizationTIM)是一种经典的转导式小样本学习方法,其通过最大化查询集的视觉特征与预测标签之间的互信息,并结合支持集中的监督信号,实现高效的小样本学习。然而,TIM的潜力尚未得到充分挖掘,主要原因在于其对视觉语言模型(如CLIP)所蕴含的文本知识利用不足。为此,本文TIM的基础上提出 TIM++,通过将视觉与文本信息有机融合,以实现对CLIP的小样本自适应优化。具体而言,TIM++引入了基于Kullback-LeiblerKL)散度的正则化项,鼓励模型的后验预测分布与CLIP的零样本输出分布尽可能相似。此外,TIM++设计了一种改进的原型初始化策略,融合了包含CLIP语义信息的支持集与查询集特征,从而获得更具判别力的特征表示。在11个公开数据集上的大量实验表明,TIM++1-shot2-shot设置下的平均准确率分别较标准TIM提升了19.25%10.88%,并且超越了现有的SOTA方法,为结合视觉语言模型的小样本学习树立了新的基准。