将智能体自主科研类比为模糊测试,揭示生成-排序范式在实验验证瓶颈下的结构性缺陷
近7日信号 1 条
提出智能体套件作为机器人自主系统的LLM驱动验证层,弥补规划与执行间可行性校验缺口
近7日信号 1 条
构建面向实时音视频问诊的专家级医疗AI框架,保留非语言线索与自然交互维度
近7日信号 1 条
揭示主流闭源LLM API存在链式推理痕迹泄露风险,提出低成本窃取方案
近7日信号 1 条
发布首个面向科学领域的知识与推理密集型视频生成评测基准Sci-VBench,覆盖60学科1253专家标注样本
近7日信号 1 条
ArchAgent v2在数据预取竞赛中验证了智能体自动化微架构探索能力,突破硬件预算与仿真瓶颈
近7日信号 1 条
提出能量结构化潜世界模型,结合神经时间场,保障开放世界运动规划的物理一致性
近7日信号 1 条
提出轨迹驱动的安全套件进化框架SHE,将LLM智能体安全从静态权重扩展至运行时上下文、工具与权限协同治理
近7日信号 1 条
BDH-CQ模型结合上下文学习与循环隐状态推理,支持动态记忆更新与迭代查询求解
近7日信号 1 条
提出思维模式融合(TMF)训练法,统一支持简洁响应与长程数学推理
近7日信号 1 条
提出无需外部验证器的测试时缩放新范式Consilience,在编程与机器人任务中实现高质推理
近7日信号 1 条
提出解码级禁忌压力测试,暴露LLM在非标生成路径下的脆弱性
近7日信号 1 条
首个嵌入开发框架的几何神经求解器,用于电力系统稳态分析,兼顾物理一致性与AI效率
近7日信号 1 条
构建面向荷兰语政务场景的价值对齐评测框架Grip,填补非英语公共管理领域LLM评估空白
近7日信号 1 条
提出多模态大模型差异分析方法,用于可解释性特征发现与可控干预
近7日信号 1 条
探究TTS自动评估模型在语言学维度上的表现,揭示其与人类感知的差距
近7日信号 1 条
200位AI专家及经济学家联名呼吁应对AI经济剧变的公开声明
近7日信号 1 条
分析LLM训练数据耗尽时间表及应对路径,指出高质量文本或于2026年枯竭
近7日信号 1 条
Google DeepMind关于大语言模型科学发现能力边界的重磅论文
近7日信号 2 条
主张科学AI需强化推理能力而非仅依赖数据拟合,反思当前LLM范式局限
「科学AI推理范式正从学术倡议走向产业共识,但尚未形成可落地的产品接口或开源基座,当前核心价值在于定义下一代科研智能体的技术坐标。」
近7日信号 2 条
提出TRIAL方法,解决智能体强化学习中回溯信号在轨迹内分配模糊问题,提升稀疏奖励下长程决策效率
近7日信号 1 条
提出面向算法原语的代码进化框架,解耦局部逻辑与宿主程序,提升LLM自动化算法设计的可解释性与复用性
近7日信号 1 条
面向交互式视频世界模型的可寻址视觉记忆机制
近7日信号 1 条
面向地理相关任务的综合性大语言模型评测基准
近7日信号 1 条
支持身份条件查询的以人为中心视频推理新任务范式
近7日信号 1 条
基于双层优化的LLM跨域校准新方法,超越后处理温度调节
近7日信号 1 条
面向直接未来预测的长视野端到端世界模型训练范式
近7日信号 1 条
面向固定推理预算的计算均衡路由实现低成本测试时缩放
近7日信号 1 条
实证揭示VLM通过视觉输入大幅降低AI推理能耗并提升精度
近7日信号 1 条
面向冲突鲁棒语言智能体的过时记忆撤销机制
近7日信号 1 条