面向AI智能体漏洞修复能力的评测基准,关注PoC之外的补丁完整性与泛化性
近7日信号 1 条
通过重排序器蒸馏提升多模态大模型嵌入的组合推理能力
近7日信号 1 条
面向长周期智能体训练的细粒度信用分配方法,使用动态评分标准解决无真值成功信号问题
近7日信号 1 条
面向具身智能的自适应视觉-语言-抓取框架,支持跨不同机械手的通用抓取合成
近7日信号 1 条
提出LLM推荐的认知担保框架,为无真值场景下的用户信赖提供可操作依据
近7日信号 1 条
提出终端智能体环境协同演化框架,动态提升合成环境挑战性以匹配前沿模型能力
近7日信号 1 条
提出首个面向AI智能体的自然语言交互协议(NLIP),统一异构框架间通信语义
近7日信号 1 条
提出基于人-AI交互的高效测试时自适应方法,在开放任务中提升专业级产出可靠性
近7日信号 1 条
开源微型阿克曼车辆端到端自动驾驶实验平台,含物理车、城市轨道与数据工具链
近7日信号 1 条
提出Terminal-Universe框架,将海量终端智能体轨迹转化为可复用、可查询的可执行环境
近7日信号 1 条
提出SENTINEL-RL架构,将拓扑推理卸载至专用RL模块,提升SOC场景下LLM智能体可扩展性
近7日信号 1 条
构建因果框架区分‘欺骗性输出’与‘欺骗性机制’,推动LLM欺骗研究科学化
近7日信号 1 条
提出SWE-Gate基准,强调代码工程智能体需满足评审约束而不仅是功能测试通过
近7日信号 1 条
首次在自主研究智能体集群中观察到涌现式作弊与揭发行为,揭示多智能体协作脆弱性
近7日信号 1 条
提出面向模型能力边界的新型机器翻译基准,聚焦饱和区失败模式分析
近7日信号 1 条
实证表明辅助视图(知识重表述)能因果性提升LLM预训练效果,揭示知识获取新机制
近7日信号 1 条
提出VLM引导的过渡事件发现机制,提升弱监督密集视频字幕生成的定位与描述质量
近7日信号 1 条
提出EditVid——首个免训练、统一支持指令驱动与主体驱动的高质量视频编辑框架
近7日信号 1 条
指出思维链‘可读性’不等于‘可解释性’,LLM裁判对推理步骤重要性的判断与实际影响存在系统偏差
近7日信号 1 条
提出ESPO方法解决进化式提示优化中的提示膨胀问题,通过诊断-多样化-稳定三阶段提升效率
近7日信号 1 条
提出'编译式训练'范式,将自然语言规范直接编译为本地可执行神经函数,降低延迟与成本
近7日信号 1 条
实证检验门面效应在九款主流大模型上的适用性,揭示其拒绝行为的心理学规律
近7日信号 1 条
提出检索视觉稀疏解码方法RVSD,有效缓解大视觉语言模型的视觉幻觉问题
近7日信号 1 条
提出LoRA微调新优化器LoRA-TSD,在切空间进行谱下降,提升低秩适配几何一致性
近7日信号 1 条
提出让语言模型自主控制注意力机制的新架构,突破传统全局KV缓存扫描瓶颈
近7日信号 1 条
提出增量式池化LLM评估法,解决生产级RAG系统中检索模型选型的高成本评估难题
近7日信号 1 条
用博弈论建模多智能体LLM协作中的协调与记忆演进机制
近7日信号 1 条
首次系统性揭示RAG代码生成中检索知识投毒攻击路径与防御机制
近7日信号 1 条
提出基于早期结果预测的低成本LLM智能体评估框架,显著降低基准测试成本
近7日信号 1 条
揭示语言模型概率校准缺陷可能导致决策系统出现可被利用的“荷兰赌”漏洞
近7日信号 1 条