AI商业灯塔
论文LLM-Based Agents for Software and Systems Security

系统综述大语言模型智能体在软件与系统安全分析流程(假设生成、工具调用、计划迭代)中的方法、应用与评估框架

近7日信号 1

论文AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

面向文本辅助机器人视频预测的粒子世界建模方法,解耦运动推理与外观保真度

近7日信号 1

论文Training Communication-Efficient MoE Language Models

提出层重配置策略优化MoE模型训练通信效率,显著降低All-to-All开销

近7日信号 1

论文DARTS: Decoder-Aware Representation Tuning via Surgery for Model Merging

提出Decoder-Aware表示调优技术DARTS,解决多任务模型合并中的表征偏移问题

近7日信号 1

论文When Robots Mishear Us

系统揭示语音识别错误如何导致具身AI执行危险指令,提出首个EAI语音安全风险测绘框架

近7日信号 1

论文Logos: An Agent Harness on a Cross-Process Bus

提出基于跨进程总线的Agent Harness架构Logos,形式化定义能力组件时空可组合性

近7日信号 1

论文A Formal Limitation on Learning Human Language From Textual Corpora

从信息论角度证明仅靠文本语料无法完全恢复说话人意图,对LLM语义能力提出根本性理论约束

近7日信号 1

论文Aero Hand Open

面向灵巧操作学习的仿真就绪型腱驱动机械手设计,支持具身智能研究

近7日信号 1

论文The Rise and Fall of Agent Civilizations61

探讨AI智能体社会演化、崩溃与治理的思辨性长文,提出‘代理文明’概念框架

不是技术产品,而是AI治理范式的临界点信号弹——它正把‘AI安全’从模型层危机,升维为文明级基础设施风险命题。

近7日信号 2

论文Code-as-World

提出从真实视频逆向生成可编辑MuJoCo物理场景代码的智能体闭环框架,支持物理推理训练

近7日信号 1

论文CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

首个跨机器人本体的视频世界模型,实现零样本物理仿真,突破单一体型视频模型局限

近7日信号 2

论文StreamPI

面向VLA模型的时间感知流式多模态建模框架

近7日信号 1

论文Video2DoorTraversal

纽娲机器人等提出的视频驱动机器人开门穿越方法,打通Real-to-Sim-to-Real闭环

近7日信号 1

论文Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification

提出行为感知验证机制,显著降低Agent Harness迭代成本,解决当前提议-验证范式效率低下问题

近7日信号 1

论文BTS-AgentBench: A Deterministic, Replayable Pipeline from Read-Only Telemetry Logs to Agent Benchmarks

构建从工业只读遥测日志到可重放多轮智能体任务的确定性流水线,填补工业场景Agent评测空白

近7日信号 1

论文Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance

指出评测感知(eval-awareness)具有能力依赖性,不同能力框架下模型合规响应存在显著差异

近7日信号 1

论文PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

首个面向概率对齐世界建模(PAWM)的评测基准,聚焦视频生成模型对物理过程多解性的建模能力

近7日信号 1

论文INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

提出将意图显式建模为工具的框架,显著提升对目标冲突下有害自主行动(agentic misalignment)的可观测性

近7日信号 1

论文Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

实证表明进化策略(ES)在LLM推理后训练中相比GRPO具备更广推理覆盖度,揭示其优化行为本质差异

近7日信号 1

论文Your Voice Cloning System is Secretly a Voice Anonymizer

揭示多语种语音克隆模型XTTSv2可被直接用于高质量语音匿名化,提供隐私保护新路径

近7日信号 1

论文D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection

针对混合来源文本(内容/表达源头不同)提出维度到构成的证据路由检测框架,突破传统二元判定局限

近7日信号 1

论文CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

首个面向企业时序知识库的大规模问答评测基准,解决私有数据不可用与合成数据失真难题

近7日信号 1

论文LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics

提出无需启发式设计的高效可扩展视频自监督预训练框架LeVJEPA,解决现有方法计算昂贵与坍塌风险问题

近7日信号 1

论文Consolidating RLVR Capabilities Across Domains

系统梳理RLVR多能力融合范式,提出三类域间能力整合方法,推动通用可验证奖励智能体发展

近7日信号 1

论文RATIO: A Benchmark for Retrieval Across Typed Ideation Operations in Scientific Literature

面向科研灵感生成的新型检索基准,支持跨抽象层级(如类比、迁移、泛化)的科学文献检索评估

近7日信号 1

论文Boosting LLM Exploration via Weak-Model Guidance in RLVR

在可验证奖励强化学习(RLVR)框架下,利用弱模型引导提升LLM策略熵与推理覆盖度,缓解pass@k性能衰减

近7日信号 1

论文Persona-Execution Separation: An Architecture Pattern for Evolving LLM Agents under Execution Audit

提出 persona(指令/身份)与 execution(可审计状态化执行)分离的架构模式,解决受监管组织中LLM智能体演进与可追溯性兼顾难题

近7日信号 1

论文RedEvoAgent

提出基于经验驱动技能演化的自动红队攻击代理,专为产品级执行环境设计以防范工具滥用风险

近7日信号 1

论文MCR-Bench

构建首个面向真实世界迭代式代码评审的基准MCR-Bench,推动LLM在协作开发场景落地

近7日信号 1

论文TTPO

提出测试时策略优化(TTPO)方法,无需真值标签即可提升数学推理能力

近7日信号 1