AI算法在孪生素数间隔问题上连续突破纪录,推动数学证明进展
近7日信号 1 条
CEPR联合学者调研发现学生使用生成式AI提升作业分数但降低考试成绩,揭示学习代价
近7日信号 1 条
通过合成奖励训练因果探索型推理智能体,拓展RLVR在诊断推理中的应用边界
近7日信号 1 条
提出样本自适应视觉令牌剪枝策略路由,降低多模态大模型推理开销
近7日信号 1 条
基于本体驱动的记忆生命周期管理,解决LLM长期记忆膨胀与检索退化问题
近7日信号 1 条
提出层选择性机器遗忘方法,提升LLM隐私与合规鲁棒性
近7日信号 1 条
引入卷积式记忆机制突破LLM长上下文推理瓶颈
近7日信号 1 条
面向跨设备GUI自动化的动态任务编排框架,推动多端协同智能体发展
近7日信号 1 条
提出基于半群结构的JEPA世界模型,提升物理规律零样本泛化能力
近7日信号 1 条
企业AI系统评测新协议,主张以服务路径(serving route)而非模型标识符为评测单元
近7日信号 1 条
提出无参考质量估计框架RBQE,利用多模型一致性作为结肠镜实时分割可靠性信号
近7日信号 1 条
基于视觉语言模型的具身智能代理框架,使VLM能直接控制机器人执行任务
近7日信号 1 条
面向研究方法实现完备性的新基准,量化论文中关键实现细节缺失程度
近7日信号 1 条
提出面向约束离散任务的连续扩散建模方法,在保持结构完整性前提下实现可控生成
近7日信号 1 条
将LLM推理建模为随机动力学过程,通过答案分布轨迹分析推理路径质量,超越终点准确率评估
近7日信号 1 条
揭示LLM决策审计中评估方式(如单次评分vs排序)本身即构成强干扰因素,其影响可超越人口统计偏差
近7日信号 1 条
提出无需微调的LLM任务向量方法,实现零样本行为控制,突破传统任务向量对微调的依赖
近7日信号 1 条
提出基于LLM自动生成可适配JavaScript游戏的高效强化学习训练框架,降低VGE构建门槛
近7日信号 1 条
首次在波兰语初级诊疗场景中对比临床AI系统Doctorina、医生与前沿大模型的诊断与管理能力
近7日信号 1 条
提出闭环工具调用数据合成框架,通过解耦生成与动态自反馈提升LLM工具使用能力
近7日信号 1 条
面向可操作同行评审生成的反驳引导训练数据与评分标准奖励机制
近7日信号 1 条
无需标注的开放词汇3D场景理解方法,通过语言空间提升实现零样本泛化
近7日信号 1 条
在持续多轮压力下系统评测大语言模型谄媚倾向的新方法
近7日信号 1 条
构建SAE科学家评测基准,评估AI智能体自主开展稀疏自动编码器可解释性研究能力
近7日信号 1 条
面向长周期LLM智能体的风险感知记忆清理方法,基于合作博弈归因机制
近7日信号 1 条
实证研究推理表示是否真正提升人类对大模型输出的评估能力
近7日信号 1 条
面向灵巧操作的物理接地VLA模型,通过接触感知潜空间共想象建模复杂交互
近7日信号 1 条
利用规范色作为探针,量化视觉编码器与多模态模型中的概念可解码性
近7日信号 1 条
面向编码智能体的执行反馈驱动测试生成与修复优化方法
近7日信号 1 条
提出智能体Harness与模型协同进化框架,使弱模型通过在线修正追赶强模型
近7日信号 1 条