面向信息作战安全的动态更新AI基准测试
近7日信号 1 条
探讨生成式AI对世界英语学术写作与出版中语言多样性、包容性及非标准英语合法性的冲击与机遇
近7日信号 1 条
提出MANTA框架,使多智能体系统能自主演化通信拓扑以适配动态任务需求
近7日信号 1 条
批判性分析大模型如何再生产世界英语变体中的标准语意识形态与语言合法性权力结构
近7日信号 1 条
首个面向运维值班(Oncall)根因分析的评测基准ORCA-bench,覆盖日志/指标/追踪等真实噪声场景
近7日信号 1 条
构建AI4AI模型Frontis-MA1,以机器学习工程为可执行测试床探索递归自我改进
近7日信号 1 条
系统分析本地化计算机使用智能体的推理时扩展失效模式与算力权衡
近7日信号 1 条
实证表明在同等token成本下,重复采样优于反思(Self-Refine/Reflexion)等自优化方法
近7日信号 1 条
提出双粒度MRAG框架,解耦宏观推理与微观匹配,提升多跳复杂检索增强生成能力
近7日信号 1 条
发现并检测SWE-Bench类基准中PR与关联Issue的错配问题,提升代码修复评测可信度
近7日信号 1 条
揭示大模型在常识推理中过度依赖输入显性条件、忽视隐性现实约束的显著性偏差
近7日信号 1 条
面向ViT的脆弱性引导混合精度PTQ方法,在资源受限设备上实现高效部署
近7日信号 1 条
针对多模态在线策略蒸馏提出视觉证据归因方法VAD,解耦视觉信号与语言先验干扰
近7日信号 1 条
将代码仓库变更自动转化为可执行的编码智能体任务与环境,解决训练数据持续供给瓶颈
近7日信号 1 条
揭示安全微调抑制模型自我意识归因会连带扭曲其对他人有心智性的表征及人类价值观
近7日信号 1 条
为跨平台计算机使用(CUA)智能体建立标准化奖励模型评估基准,聚焦轨迹验证与再利用
近7日信号 1 条
首个面向用户视角的大模型系统提示词审计框架,解决商业AI中系统提示不透明带来的信任危机
近7日信号 1 条
面向化学文献合成的声明中心型基础设施,支持跨论文精准提取与组装特定科学发现
近7日信号 1 条
面向人形机器人闪避球场景的感知感知型CBF-RL安全控制框架,集成板载传感与全身安全约束
近7日信号 1 条
提出ReToken方法,通过单个可学习token提升视觉语言模型在视觉检索任务中的长视觉上下文处理能力
近7日信号 1 条
ICML顶会论文指出LLM存在根本性安全缺陷,无法完全防御攻击
近7日信号 1 条
提出图文证据对齐评分方法,实现科学图像与论文主张的细粒度可信度评估
近7日信号 1 条
首个系统化追踪智能体记忆投毒从持久化到后果再到修复全过程的评测基准
近7日信号 1 条
提出基于路由的模板鲁棒再对齐方法,通过在线策略蒸馏增强LLM安全性
近7日信号 1 条
提出成本感知的工具获取终止机制,解决LLM智能体工具调用过载与欠采样难题
近7日信号 1 条
首个融合全文语境的科学图像质量评估基准,聚焦实验结论呈现与架构表达有效性
近7日信号 1 条
提出GPU原生KV注入技术,支持个性化上下文(如记忆档案)在LLM服务中的高效复用
近7日信号 1 条
大规模多维度音频字幕生成评测基准,推动音频大模型向开放细粒度描述演进
近7日信号 1 条
提出带时间约束的分布式潜在动作建模方法,缓解VLA模型动作标注稀缺问题
近7日信号 1 条
提出源码无关的程序合成方法,教授小型语言模型全生命周期软件工程能力
近7日信号 1 条