AI商业灯塔
论文RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

提出以推理为枢纽的多语言推理迁移自蒸馏方法,提升LLM在低资源语言上的推理泛化能力

近7日信号 1

论文CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

提出面向可学习终端任务的对抗性求解器校准框架,解决任务难度适配与可验证性难题

近7日信号 1

论文Resourced Authority: A Mechanism-Design Model for Participatory Governance of Deployed AI Agents

提出基于资源分配机制设计的AI代理持续参与式治理模型,将授权决策与资源控制绑定

近7日信号 1

论文The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

揭示视频语言模型在低频事件计数等基础事件跟踪任务上的系统性失败,暴露现有基准的缺陷

近7日信号 1

论文AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping

提出一种在不完全信息博弈中对AI代理进行低成本、可认证任意时刻终止的评估方法,显著降低评估开销

近7日信号 1

论文The Bitter Lesson of Tool Calling

提出程序化工具调用可替代僵化的JSON调用,使LLM代理能自然链式与并行调用工具,扩展其超越训练数据的行动能力

近7日信号 1

论文Masked Visual Actions for Unified World Modeling

李飞飞与Yilun Du等联合提出的视频大模型与机器人动作接口统一框架,打通视觉-动作闭环

近7日信号 1

论文Gradient Immunity

提出零空间抗恶意微调防御机制,使对齐后大模型在下游微调中抵抗梯度投毒攻击,无需依赖服务端或用户额外操作

近7日信号 2

论文ArtAnno

构建双向人-AI协同标注框架,利用LLM智能体挖掘艺术品隐含语义,解决文化语境依赖导致的细粒度艺术标注瓶颈

近7日信号 1

论文SparseDitto

首个由LLM智能体驱动的GPU稀疏矩阵核定制系统,根据动态稀疏模式自动生成优化CUDA内核

近7日信号 1

论文MarsCast

首次将地球气象基础模型GraphCast迁移至火星大气建模,验证跨行星天气AI基础模型的可迁移性与泛化边界

近7日信号 1

论文RepairFormer

基于Transformer的结构化输入(JSON/DOT/INI等)自动修复模型,解决配置文件微小损坏导致解析失败的工程痛点

近7日信号 1

论文Provable Limits and Certified Deferral for Verbalized Uncertainty

为小型开源语言模型建立可证明的不确定性口头表达置信度下界,提出可认证的人类接管触发机制

近7日信号 1

论文Capability-Gated Planning

提出能力门控规划框架,揭示短视实验选择在科学发现自动化中的根本局限,并定义成本-目标可发现性边界

近7日信号 1

论文Item Response Theory for AI Safety

将项目反应理论引入AI安全评估,解决安全基准重复、强相关及模型策略性规避问题,提供可解释的能力-风险分离度量

近7日信号 1

论文Hierarchical Graph Memory for LLM Agents

提出带路径级定位与重写的分层图记忆架构,提升LLM智能体长期推理中的记忆更新效率与结构化能力

近7日信号 1

论文Same Formulas, Different Semantics

首次系统检验大语言模型是否遵循模态逻辑语义规范,揭示其推理与形式逻辑的结构性偏差

近7日信号 1

论文ABSeeker

提出Answer-Backtracked信用分配机制,用于训练长视野搜索智能体,解决轨迹内步骤信用稀释问题

近7日信号 1

论文CoPlan

提出基于角色化可争辩论证图的可信协同护理规划接口 CoPlan,支持临床团队与患者共同构建、挑战与修正 AI 辅助决策路径

近7日信号 1

论文Chained Recursive Language Models

提出链式递归语言模型架构,解耦上下文探索、状态存储、证据验证与答案生成四阶段,突破单次推理轨迹瓶颈

近7日信号 1

论文Spoken Function Calling

提出语音函数调用新范式,将语音理解与功能执行深度耦合,提升大语音语言模型在任务型对话中的端到端鲁棒性

近7日信号 1

论文OPD-V

提出视觉在线策略自蒸馏 OPD-V 方法,通过模态平衡机制优化多模态大模型视觉推理能力,在 VQA 和视觉推理基准上取得新 SOTA

近7日信号 1

论文Teaching Nemotron Greek

为 NVIDIA Nemotron 系列模型补全现代希腊语 RAG 能力,构建首个覆盖法律、能源、医疗等领域的专业希腊语检索语料与适配方法

近7日信号 1

论文Toward Skill-Native LLMs

提出技能熵(Skill Entropy)度量框架,用于评估和训练能动态切换技能的长程推理大模型,首次量化跨技能推理能力

近7日信号 1

论文OctoLong

提出跨代码仓库中长期上下文建模方法 OctoLong,在 mid-training 阶段注入跨项目代码上下文,显著增强模型长程依赖建模能力

近7日信号 1

论文Argus

提出通用型长程推理智能体运行时 Argus,支持证据驱动的持久化执行与目标失配自适应转向,显著提升复杂任务成功率

近7日信号 1

论文Reasoning Core

提出面向 completion-supervised 训练的程序化推理问题生成器集合,覆盖数学、逻辑、规划等50类可验证任务,推动长程推理数据构建范式演进

近7日信号 1

论文《科技想要什么》重读

AI Agent时代对凯文·凯利经典著作的技术哲学再诠释

近7日信号 1

论文When and Where to Look

提出自适应视觉证据调度机制,动态选择长视频关键帧以提升VLM理解效率

近7日信号 1

论文Equivariant Music Transformer

分析标准音乐Transformer缺乏平移与转调等变性,并提出具备该性质的新架构

近7日信号 1