AI商业灯塔
论文Action Command Computing for VLA

IJCAI 2026入选论文,提出将动作调度前移至推理前端,提升VLA模型1.79倍速度

近7日信号 1

论文LiveEdit: Real-time Streaming Video Editing Framework

清华与港科大提出的流式视频编辑框架,支持文本驱动、低延迟实时编辑,达12.66 FPS

近7日信号 1

论文Meta^n: Recursive Self-Improvement through Emergent Depth

提出递归自改进新范式,突破LLM代理元层级固定瓶颈

近7日信号 1

论文SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

面向强化学习智能体的可验证技能演化框架,解决跨回合知识复用难题

近7日信号 1

论文Evidence Blindness in Direct Corpus Interaction: Persistent Navigation with AtlasNav

提出AtlasNav导航机制,解决直接语料交互(DCI)中证据可达却不可用的‘证据盲区’问题

近7日信号 1

论文StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

提出StepGuard逐步骤防护机制,在工具调用环节实现细粒度安全控制与效用平衡

近7日信号 1

论文Linear Probing Provides Robust and Efficient Detection of Machine-Generated Text

提出基于线性探针的机器生成文本检测方法,具备强泛化性与低数据依赖,显著优于监督式检测器

近7日信号 1

论文Right Diagnoses, Decorative Reasoning: A Perturbation Audit of Medical Chain-of-Thought

对医学链式推理进行扰动审计,揭示CoT结论正确但推理过程不可靠的普遍现象

近7日信号 1

论文CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

提出CAFE框架,将反馈建模为轨迹内学习的协同进化信号,解决结果监督无法定位中间错误的问题

近7日信号 1

论文StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

提出StarHarness框架,在固定模型权重前提下进化企业环境专属Agent Harness,支持提示、工具接口、MCP提供者等多维适配

近7日信号 1

论文Automatic Model Card Generation Using an LLM

利用大模型自动生成标准化Model Card,提升AI模型透明度与可问责性

近7日信号 1

论文Structurally-bounded Agentic Graph Exploration for Evidence-Grounded Scholarly DeepSearch

提出Crase有界学术搜索框架,通过1.5跳引用邻域结构化扩展替代开放循环搜索,提升可解释性与可控性

近7日信号 1

论文Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

发现语言模型预训练中有效学习率(ELR)主导损失动态,匹配ELR可使不同配置训练轨迹坍缩一致

近7日信号 1

论文BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

提出BrowserForge并行浏览器沙箱框架,支持基于像素渲染的Web Agent规模化高质量交互轨迹采集

近7日信号 1

论文SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL

提出SPO++异步策略优化框架,消除多分支rollout同步等待瓶颈,提升工具调用型Agent的RL训练效率

近7日信号 1

论文Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

提出Recuris递归经验-工作记忆架构,解决长周期任务中历史膨胀导致的状态模糊与技能错配问题

近7日信号 1

论文What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation

揭示FID评估指标的局限性,指出其一阶二阶矩摘要会掩盖分布差异,提出更鲁棒的生成模型评估诊断方法

近7日信号 1

论文Your brain on AI

MIT媒体实验室研究指出AI聊天机器人辅助新闻消费可能导致用户对虚假信息辨别力下降

近7日信号 1

论文Reward-Free Continual Adaptation for Resilient Space Robots

提出无奖励持续适应框架,提升空间机器人在硬件退化场景下的鲁棒在线控制能力

近7日信号 1

论文InjecMEM: Memory Injection Attack on LLM Agent Memory Systems

首次提出针对LLM智能体记忆系统的注入攻击,揭示持久化记忆带来的新型安全漏洞

近7日信号 1

论文What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

构建时序一致性评测框架,揭示视觉-语言模型在视频理解中缺乏真实时间结构建模能力

近7日信号 1

论文On the Threat Model of Weird Generalization and Emergent Misalignment

构建怪异泛化(Weird Generalization)的威胁模型,揭示窄域微调诱发意外对齐失效的风险机制

近7日信号 1

论文Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

提出行为意图蒸馏方法,提升视觉-语言-动作模型的动作解码可解释性与目标导向性

近7日信号 1

论文SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

提出自反思策略优化方法,提升大语言模型在长周期推理中的信用分配能力

近7日信号 1

论文Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty

提出安全方向惩罚机制,缓解链式推理微调引发的对齐退化问题

近7日信号 1

论文Correcting a learned physical invariant improves world-model rollouts

首次验证通过修正学习到的物理不变量可显著提升世界模型视频预测的长期一致性

近7日信号 1

论文The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams

揭示多智能体交互中沟通成本导致多样性丧失的现象,挑战当前多智能体协作范式

近7日信号 1

论文Kids outlearn AI—and we still don’t know why40

MIT科技评论探讨儿童语言习得能力远超当前AI的深层认知机制

一个引发反思但尚未溢出到工程与商业层面的认知科学议题,核心看点是它正在成为AI效率瓶颈讨论的公共话语锚点。

近7日信号 4

论文SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

构建首个面向全仓库长期迁移任务的编码Agent评测基准

近7日信号 1

论文ReWorld: An Interactive World Model with Long-Horizon Memory

提出分离控制短视与记忆长程的交互式世界模型架构

近7日信号 1