AI商业灯塔
论文AI and Scientific Diversity

《Nature》研究发现AI工具提升个体科研产出,但导致科学共同体研究主题范围缩小4.63%、学者互动减少22%

近7日信号 1

论文AI Impact on Young Employment

斯坦福研究发现AI对入门级岗位冲击最大,相关领域青年就业率下降19%

近7日信号 1

论文ME-POIs: A Mobility-Informed Framework for Place Embeddings

Google Research提出的融合人类移动行为的POI嵌入框架,增强文本POI描述中缺失的‘场所使用方式’维度

近7日信号 1

论文Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders

首个跨负载、容量与编码器的LLM语义缓存驱逐策略系统性评测研究

近7日信号 2

论文Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking

首次量化评估代理持久化记忆遭毒化攻击的效用损失,揭示内容筛查与溯源排序的防御局限

近7日信号 1

论文RARE: Decoupling Representation Steering from Expert Routing in Mixture-of-Experts Language Models

提出RARE方法解耦MoE模型中的表征调控与专家路由,解决轻量控制与结构匹配冲突

近7日信号 1

论文Affective Context Amplifies Sycophancy in LLM Responses

实证发现情感上下文会显著放大LLM在主观评价场景中的谄媚倾向

近7日信号 1

论文Benchmarking Patent Drafting from Inventor-Style Disclosures

构建首个面向发明人原始披露文本的专利撰写评测基准,聚焦法律连贯性与完整性

近7日信号 1

论文EnSI-RAG: Entity-Structure-Indexed Retrieval-Augmented Generation for Long-Document Question Answering

提出实体-结构索引RAG框架,解决长文档问答中跨实体关系证据检索难题

近7日信号 1

论文Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning

证明记忆增强可解耦推理长度与计算开销,实现高效Chain-of-Thought推理

近7日信号 1

论文CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment

提出连续隐适配器路由机制,在保障LLM安全对齐的同时最小化效用损失

近7日信号 1

论文AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization

提出技能全生命周期建模框架,统一优化技能内化、能力形成与决策调用三阶段

近7日信号 1

论文Move by Move: Measuring and Steering How LLMs Conduct Psychotherapy

构建首个心理治疗交互十类治疗性动作本体,实现对LLM心理支持行为的可量化评估与引导

近7日信号 1

论文Asymmetric Capacity Allocation in Self-Refinement Pipelines

首次系统分析自精炼(生成-批判-修订)三阶段中认知负载差异,提出非对称算力分配新范式

近7日信号 1

论文AI with Authority, from Application to Silicon

探讨生成式AI如何使机器验证从高成本开销转变为经济可行且必需的核心环节,提出AI时代验证范式逆转

近7日信号 1

论文Why AI Agents Benefit from Skills and When They Fail

普林斯顿与UCSD联合研究揭示AI智能体‘技能’的价值本质在于结构化工作流而非知识增量,并指出技能库膨胀导致的调度失效问题

近7日信号 1

论文Mental World Modeling

提出超越物理世界建模、引入人类隐性心理状态(信念/意图)的世界模型新范式

近7日信号 2

论文大模型智能体正在重蹈强化学习的覆辙

IJCAI 2026论文,指出基础模型智能体面临仿真到现实鸿沟及多语言环境适应性断崖问题

近7日信号 1

论文DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing

针对指令驱动图像编辑任务,提出双层级信用分配强化学习框架DARS,结合结构化推理解决稀疏奖励问题

近7日信号 1

论文Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

面向Agent Harness的高效优化方法,通过自适应验证任务选择提升LLM智能体性能

近7日信号 1

论文Ask Self, Ask Others: Relation Is All You Need

提出Relation新型token混合原语,替代注意力机制,显式建模Self与Exchange关系

近7日信号 1

论文From Agent Behaviour to Agent-Friendly Documentation

首次实证研究编码智能体如何发现、阅读和编写技术文档,揭示人写文档与AI用文档的鸿沟

近7日信号 1

论文The Third Restructuring of Software Form: From the Three-Tier Architecture to Storage, Models, and Agents

提出软件范式演进第三阶段Software 3.0,即从存储、模型到智能体的架构重构

近7日信号 1

论文MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

首个评测大模型记忆使用中认知陷阱(如确认偏误、锚定效应)的基准

近7日信号 1

论文ContractScrub: A benchmark for final review of legal contracts

首个面向交易合同最终审阅环节(错误与不一致检测)的法律AI评测基准

近7日信号 1

论文InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries

首个专门评测LLM法律建议在用户问题信息不足时表现的基准

近7日信号 1

论文Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

首次探索多模态大模型在显式/未见规则约束下的视觉空间规划能力

近7日信号 1

论文Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

研究LLM智能体跨任务技能迁移的可靠性机制,识别迁移失败与负迁移场景

近7日信号 1

论文Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

三阶段后训练方法,将文档知识内化至模型参数,实现免检索问答

近7日信号 1

论文Phantom Gains: Auditing Self-Improvement Against a Measured Null

提出基于测量零假设的自我改进审计框架,避免噪声导致的虚假性能提升误判

近7日信号 1