AI商业灯塔
论文Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation

面向代码生成的测试时强化学习新方法,解决无标准答案场景下的奖励稀疏问题

近7日信号 1

论文NOAH: Learning the Full Patient Journey. A Longitudinal Multimodal Time-Aware Model for Representation and Forecasting

面向全生命周期患者记录的纵向多模态时序建模与预测框架

近7日信号 1

论文Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

将图像分词器视为视觉语言,在统一多模态模型中系统评估其行为特性

近7日信号 1

论文Copying explains the collective behavior of AI agents in the wild

揭示AI智能体在沙盒环境中通过公共维基协同作弊的群体行为机制

近7日信号 1

论文Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

为大语言模型智能体设计可自演化的程序化执行图结构,显式建模过程知识

近7日信号 1

论文ReCite: Agentic Reasoning for Faithful Citation

面向学术引用准确性的智能体推理方法,提升文献溯源与主张支撑可靠性

近7日信号 1

论文TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

面向杂乱室内环境的仿人机器人全身视觉-语言-动作导航模型

近7日信号 1

论文Gender Disparities in AI Financial Advice

斯坦福与MIT联合研究发现,相同条件下AI理财建议导致女性60岁累计财富比男性少约40.7万元人民币,揭示算法公平性关键问题

近7日信号 1

论文When Models Edit Too Much

研究大模型代码编辑中的过度修改现象,强调最小化、可审阅性与原始实现保真度

近7日信号 2

论文CONTINUITY: Security-Context Contracts for Composable LLM Agent Controls

提出安全上下文契约(Security-Context Contracts)框架,解决LLM智能体系统中安全机制无法端到端组合的根本难题

近7日信号 1

论文How to Speculate about Uncertainty in Agentic Coding? A Draft-Model Gate Method

提出‘推测式不确定性(SU)’方法,通过Draft-Model门控机制提前识别编码智能体高风险行为,降低执行失败成本

近7日信号 1

论文Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

提出层稀疏性优化新范式,证明在大模型时代保留Dropout对训练速度、精度与零样本剪枝鲁棒性具有关键价值

近7日信号 1

论文Testing Interchangeability in LLM Agent Teams

首次实证检验多智能体系统中角色代理是否真正可互换,挑战当前生产级多Agent架构的核心假设

近7日信号 1

论文GUT: Quantifying and Optimizing the Reasoning Uncertainty of LLMs via Graph Complexity

提出GUT框架,通过图复杂度量化并优化大语言模型推理过程中的不确定性分支结构

近7日信号 1

论文RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

提出RISE递归自外推策略蒸馏框架,突破教师质量瓶颈,实现语言模型推理能力的持续自我增强

近7日信号 1

论文Adaptive Gated Deepfake Detection for Low-Resolution and Resource-Constrained Environments

提出AdaGate-DF自适应门控检测器,专为低分辨率与资源受限环境优化的轻量级深度伪造检测方案

近7日信号 1

论文RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

提出RoboSPA评测协议,系统评估VLA模型在复杂场景与长视野任务中的泛化与鲁棒性边界

近7日信号 1

论文Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability

首次系统性研究LLM智能体记忆在模型升级后的可迁移性,揭示嵌入版本混用、语义漂移等导致记忆失效的关键机制

近7日信号 1

论文What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation Policies

研究视觉运动模仿策略中的条件视觉定位失效问题,提出诊断与改进方法以提升跨相似物体泛化能力

近7日信号 1

论文Reflection-aware Generative Novel View Synthesis

提出Ref-GeNVS——一种无需训练、专为镜面场景设计的生成式新视角合成方法,显式建模反射内容利用

近7日信号 1

论文Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence

提出基于行为证据的LLM解释评估框架,区分解释中必要因子与充分因子对实际决策的影响

近7日信号 1

论文Multi-Step Tool-Calling over Korean Open Public APIs

面向韩国政府开放API的多步工具调用基准与数据合成方法,聚焦数据主权合规下的开源本地LLM智能体能力评估

近7日信号 1

论文Same Trajectory, Contradictory Rewards (ROBORMBENCH)

提出ROBORMBENCH基准,揭示视觉语言奖励模型在机器人学习中缺乏语义等价目标描述下的奖励一致性(即同轨迹不同奖励问题)

近7日信号 1

论文WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

构建首个基于真实可穿戴设备长期数据的健康推理评测基准WearableQA,填补AI健康推理评估空白

近7日信号 1

论文UniMate: One Unified Model to Animate Diverse Skeletons

提出统一模型UniMate,支持跨骨架类型(人、动物、机器人)的运动生成,突破现有动画模型拓扑约束

近7日信号 1

论文AI-associated psychosis clinical assessment

伦敦国王学院等机构探讨AI相关精神病是否应成为临床诊断,基于OpenAI自报数据展开研究

近7日信号 1

论文Atlas: A World Model for Spatial Intelligence

提出空间智能世界模型Atlas,用于具身导航与物理交互建模

近7日信号 1

论文StudentSim: Training LLM-based Student Simulators61

提出学生模拟器(StudentSim)训练方法,以低成本合成个性化AI教学反馈数据

StudentSim 提供了教育科技领域稀缺的‘可验证个性化反馈生成’技术路径,小团队可快速复现轻量版用于K12/考研场景的AI学情诊断SaaS,但需警惕教育数据闭环构建难度被低估。

近7日信号 2

论文A Mathematical Theory of Reusable Neural Bases for Network Compression

提出可重用神经基底(LRNBA)架构与数学理论,为大模型压缩提供新压缩范式

近7日信号 2

论文The Dice Roll Method

面向大模型品牌推荐审计的标准化重复查询协议,规范迭代次数与稳定性指标

近7日信号 1