面向长周期办公套件任务、具备经济性评估能力的LLM智能体基准
近7日信号 1 条
提出SpecFirst范式,将行为规格获取作为从零构建Agent程序的第一步,弥合LLM在无代码库环境下的编程鸿沟
近7日信号 1 条
通过生成关联用户意图提升电商搜索的商品发现能力,平衡精度与召回率
近7日信号 1 条
提出面向任务无关适配的伙伴能力估计算法,提升自主智能体在非固定协作场景中的泛化能力
近7日信号 1 条
提出完全开源的稠密+晚期交互检索模型训练方案,解决多语言与长上下文检索的可复现性问题
近7日信号 1 条
揭示AI作为团队成员时如何实质性重塑人类小团队决策中的沟通模式与社会认知动态
近7日信号 1 条
由Mercor与Ramp共建的前沿大模型会计能力评测基准,覆盖对账、费用计提、记账及报表生成等真实工作流
近7日信号 1 条
首次通过实证案例研究探讨AI代理能否开展真正开放式的AI科研,填补关键证据空白
近7日信号 1 条
提出仅通过输入提示优化即可抑制LLM中特定评估感知潜变量的方法,无需运行时模型访问
近7日信号 1 条
基于SAM3D引导的物体中心表征对齐方法,增强VLA模型在遮挡与姿态变化下的3D细粒度理解能力
近7日信号 1 条
面向自治网络L4-L5级提出跨厂商AI工具信任管理标准框架,解决多厂商工具调用时的信任可见性缺失问题
近7日信号 1 条
提出局部化潜在循环机制以提升结构化推理效率,避免单纯扩大参数量或链式思维token化
近7日信号 1 条
首个理论驱动的政治信息中介评估基准,用于衡量LLM在选举与政治场景中负责任的信息传递能力
近7日信号 1 条
实证研究运行时拓扑上下文对LLM生成Kubernetes安全补丁质量的影响,探索云原生安全自动化新路径
近7日信号 1 条
提出并行解码蒸馏方法,显著加速视频扩散/流模型生成,摆脱对变分分数蒸馏和对抗损失的依赖
近7日信号 1 条
首个专门评估计算机使用模型对桌面GUI状态迁移理解能力的基准,聚焦因果性与任务相关性重建
近7日信号 1 条
提出一种根据token不确定性动态调整专家数量的MoE LoRA路由机制,解决固定k值导致的资源浪费与覆盖不足问题
近7日信号 1 条
针对多模态大模型视频定位任务提出的稀疏帧自适应方法
近7日信号 1 条
首个聚焦体育领域真实世界预测能力的大模型评测基准
近7日信号 1 条
首次系统评估模糊测试在强化学习智能体安全验证中的有效性
近7日信号 1 条
面向长视频理解的置信度感知动态证据推理框架
近7日信号 1 条
基于隐状态谱特征的LLM幻觉检测新指标D-Score
近7日信号 1 条
基于经验增强的LLM智能体实现端到端极端天气预警的新型框架
近7日信号 1 条
提出AI从科研辅助工具演变为AI科学家,需重构科研组织管理模式
近7日信号 1 条
用于评估大模型代码能力的基准测试数据集
近7日信号 1 条
批判性分析当前智能体评测协议有效性,指出任务设计与能力声称间的逻辑断裂风险,呼吁建立协议效度验证标准
近7日信号 1 条
提出IDEAgent框架,首次实现科研创意生成中质量(Quality)与多样性(Diversity)的联合优化搜索,突破单目标局限
近7日信号 1 条
面向工业异常诊断的证据驱动型智能体根因分析框架,支持假设生成与多源传感器证据自动采集验证
近7日信号 1 条
提出算法-硬件协同的HiKV缓存机制,通过分层重要性感知压缩KV缓存,缓解长上下文LLM推理内存瓶颈
近7日信号 1 条
首个面向多物体完整3D场景交互动作能力评估的基准,聚焦VLM智能体在真实3D环境中的具身行动而非仅文本描述
近7日信号 1 条