AI商业灯塔
论文AI-Driven Advances in Bounded Gaps Between Primes

AI算法在孪生素数间隔问题上连续突破纪录,推动数学证明进展

近7日信号 1

论文CEPR Study on Generative AI Learning Costs

CEPR联合学者调研发现学生使用生成式AI提升作业分数但降低考试成绩,揭示学习代价

近7日信号 1

论文TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards

通过合成奖励训练因果探索型推理智能体,拓展RLVR在诊断推理中的应用边界

近7日信号 1

论文Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs

提出样本自适应视觉令牌剪枝策略路由,降低多模态大模型推理开销

近7日信号 1

论文Fortunate Recall: Ontology-Driven Memory Lifecycle Management for Persistent Coherence in LLMs

基于本体驱动的记忆生命周期管理,解决LLM长期记忆膨胀与检索退化问题

近7日信号 1

论文Forgetting Only What Matters: Layer-Selective Unlearning toward Robust LLMs

提出层选择性机器遗忘方法,提升LLM隐私与合规鲁棒性

近7日信号 1

论文ConvMem: Convolutional Memory for Long-Context Reasoning

引入卷积式记忆机制突破LLM长上下文推理瓶颈

近7日信号 1

论文JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition

面向跨设备GUI自动化的动态任务编排框架,推动多端协同智能体发展

近7日信号 1

论文Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization

提出基于半群结构的JEPA世界模型,提升物理规律零样本泛化能力

近7日信号 1

论文IBIB Protocol

企业AI系统评测新协议,主张以服务路径(serving route)而非模型标识符为评测单元

近7日信号 1

论文Cross-Model Agreement for Polyp Segmentation

提出无参考质量估计框架RBQE,利用多模型一致性作为结肠镜实时分割可靠性信号

近7日信号 1

论文Show-Harness

基于视觉语言模型的具身智能代理框架,使VLM能直接控制机器人执行任务

近7日信号 1

论文IdeaAMBIG

面向研究方法实现完备性的新基准,量化论文中关键实现细节缺失程度

近7日信号 1

论文Let It Go or Learn to Self-Correct: Continuous Diffusion for Constrained Discrete Tasks

提出面向约束离散任务的连续扩散建模方法,在保持结构完整性前提下实现可控生成

近7日信号 1

论文Answer-Distribution Trajectories: A Stochastic-Dynamics View of LLM Reasoning

将LLM推理建模为随机动力学过程,通过答案分布轨迹分析推理路径质量,超越终点准确率评估

近7日信号 1

论文The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits

揭示LLM决策审计中评估方式(如单次评分vs排序)本身即构成强干扰因素,其影响可超越人口统计偏差

近7日信号 1

论文Training-Free Task Vectors for LLM Behavioral Control

提出无需微调的LLM任务向量方法,实现零样本行为控制,突破传统任务向量对微调的依赖

近7日信号 1

论文PlayTrain: An Efficient Reinforcement Learning Framework for LLM-Generated Adaptable JavaScript Games

提出基于LLM自动生成可适配JavaScript游戏的高效强化学习训练框架,降低VGE构建门槛

近7日信号 1

论文Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics

首次在波兰语初级诊疗场景中对比临床AI系统Doctorina、医生与前沿大模型的诊断与管理能力

近7日信号 1

论文ToolLoop: Closed-Loop Tool-Use Data Synthesis via Decomposed Generation and Dynamic Self-Feedback

提出闭环工具调用数据合成框架,通过解耦生成与动态自反馈提升LLM工具使用能力

近7日信号 1

论文ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

面向可操作同行评审生成的反驳引导训练数据与评分标准奖励机制

近7日信号 1

论文GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting

无需标注的开放词汇3D场景理解方法,通过语言空间提升实现零样本泛化

近7日信号 1

论文Measuring LLM Sycophancy under Sustained Multi-Turn Pressure

在持续多轮压力下系统评测大语言模型谄媚倾向的新方法

近7日信号 1

论文SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

构建SAE科学家评测基准,评估AI智能体自主开展稀疏自动编码器可解释性研究能力

近7日信号 1

论文MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents

面向长周期LLM智能体的风险感知记忆清理方法,基于合作博弈归因机制

近7日信号 1

论文Do Reasoning Representations Help Humans Evaluate LLM Outputs?

实证研究推理表示是否真正提升人类对大模型输出的评估能力

近7日信号 1

论文DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

面向灵巧操作的物理接地VLA模型,通过接触感知潜空间共想象建模复杂交互

近7日信号 1

论文Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMs

利用规范色作为探针,量化视觉编码器与多模态模型中的概念可解码性

近7日信号 1

论文ExecCritic: Learn to Test, Test to Improve for Coding Agents

面向编码智能体的执行反馈驱动测试生成与修复优化方法

近7日信号 1

论文Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

提出智能体Harness与模型协同进化框架,使弱模型通过在线修正追赶强模型

近7日信号 1