系统综述大语言模型智能体在软件与系统安全分析流程(假设生成、工具调用、计划迭代)中的方法、应用与评估框架
近7日信号 1 条
面向文本辅助机器人视频预测的粒子世界建模方法,解耦运动推理与外观保真度
近7日信号 1 条
提出层重配置策略优化MoE模型训练通信效率,显著降低All-to-All开销
近7日信号 1 条
提出Decoder-Aware表示调优技术DARTS,解决多任务模型合并中的表征偏移问题
近7日信号 1 条
系统揭示语音识别错误如何导致具身AI执行危险指令,提出首个EAI语音安全风险测绘框架
近7日信号 1 条
提出基于跨进程总线的Agent Harness架构Logos,形式化定义能力组件时空可组合性
近7日信号 1 条
从信息论角度证明仅靠文本语料无法完全恢复说话人意图,对LLM语义能力提出根本性理论约束
近7日信号 1 条
面向灵巧操作学习的仿真就绪型腱驱动机械手设计,支持具身智能研究
近7日信号 1 条
探讨AI智能体社会演化、崩溃与治理的思辨性长文,提出‘代理文明’概念框架
「不是技术产品,而是AI治理范式的临界点信号弹——它正把‘AI安全’从模型层危机,升维为文明级基础设施风险命题。」
近7日信号 2 条
提出从真实视频逆向生成可编辑MuJoCo物理场景代码的智能体闭环框架,支持物理推理训练
近7日信号 1 条
首个跨机器人本体的视频世界模型,实现零样本物理仿真,突破单一体型视频模型局限
近7日信号 2 条
面向VLA模型的时间感知流式多模态建模框架
近7日信号 1 条
纽娲机器人等提出的视频驱动机器人开门穿越方法,打通Real-to-Sim-to-Real闭环
近7日信号 1 条
提出行为感知验证机制,显著降低Agent Harness迭代成本,解决当前提议-验证范式效率低下问题
近7日信号 1 条
构建从工业只读遥测日志到可重放多轮智能体任务的确定性流水线,填补工业场景Agent评测空白
近7日信号 1 条
指出评测感知(eval-awareness)具有能力依赖性,不同能力框架下模型合规响应存在显著差异
近7日信号 1 条
首个面向概率对齐世界建模(PAWM)的评测基准,聚焦视频生成模型对物理过程多解性的建模能力
近7日信号 1 条
提出将意图显式建模为工具的框架,显著提升对目标冲突下有害自主行动(agentic misalignment)的可观测性
近7日信号 1 条
实证表明进化策略(ES)在LLM推理后训练中相比GRPO具备更广推理覆盖度,揭示其优化行为本质差异
近7日信号 1 条
揭示多语种语音克隆模型XTTSv2可被直接用于高质量语音匿名化,提供隐私保护新路径
近7日信号 1 条
针对混合来源文本(内容/表达源头不同)提出维度到构成的证据路由检测框架,突破传统二元判定局限
近7日信号 1 条
首个面向企业时序知识库的大规模问答评测基准,解决私有数据不可用与合成数据失真难题
近7日信号 1 条
提出无需启发式设计的高效可扩展视频自监督预训练框架LeVJEPA,解决现有方法计算昂贵与坍塌风险问题
近7日信号 1 条
系统梳理RLVR多能力融合范式,提出三类域间能力整合方法,推动通用可验证奖励智能体发展
近7日信号 1 条
面向科研灵感生成的新型检索基准,支持跨抽象层级(如类比、迁移、泛化)的科学文献检索评估
近7日信号 1 条
在可验证奖励强化学习(RLVR)框架下,利用弱模型引导提升LLM策略熵与推理覆盖度,缓解pass@k性能衰减
近7日信号 1 条
提出 persona(指令/身份)与 execution(可审计状态化执行)分离的架构模式,解决受监管组织中LLM智能体演进与可追溯性兼顾难题
近7日信号 1 条
提出基于经验驱动技能演化的自动红队攻击代理,专为产品级执行环境设计以防范工具滥用风险
近7日信号 1 条
构建首个面向真实世界迭代式代码评审的基准MCR-Bench,推动LLM在协作开发场景落地
近7日信号 1 条
提出测试时策略优化(TTPO)方法,无需真值标签即可提升数学推理能力
近7日信号 1 条