AI商业灯塔
论文Split the Labor: Separating Evidence Interpretation from Decision Aggregation

提出将证据解释与决策聚合解耦的新型推理架构,解决多源信息融合中能力错配问题

近7日信号 1

论文Handover of In-Context Learning State Across Session Boundaries

首次系统研究大模型上下文学习状态在会话边界间的迁移机制,为长任务连续推理提供新范式

近7日信号 1

论文Marionette: Predicting World States, Rendering Geometry, Painting Appearance

提出一种解耦世界状态预测、几何渲染与外观绘制的交互式游戏世界模型框架,提升长程结构化建模能力

近7日信号 1

论文Generative AI Design of Novel Viruses

斯坦福团队在《科学》发表论文,利用生成式AI设计16种自然界不存在的病毒DNA序列,验证AI在合成生物学中的生成能力

近7日信号 1

论文LLMs as Calculators vs Creative Thinkers

戈尔斯与萨纳克指出大模型擅长组合已有方法但缺乏数学直觉

近7日信号 1

论文One in five US workers now delegates tasks to AI instead of colleagues

Epoch AI调研显示20%美国工作者将任务委托给AI而非同事

近7日信号 1

论文认知公地悲剧

提出AI采用导致专业领域集体专业知识衰退的‘认知公地悲剧’理论框架

近7日信号 1

论文法庭文件中的隐形AI指令注入

研究揭示原告在法院文件中嵌入不可见提示词以操纵AI审查系统

近7日信号 1

论文至知研究院大模型可解释性新路线

提出拆解权重的低数据成本大模型可解释性方法,无需训练替代网络

近7日信号 1

论文Vero: Can AI Agents Build Formally Verified Software Repositories?

探索AI智能体生成带机器可验证证明的代码仓库的可行性,推动可信编程智能体发展

近7日信号 1

论文QuoteBench: How Matched Scores Can Hide Command-Path Failures

提出QuoteBench基准,揭示LLM编码智能体在Bash命令生成与执行链路中被匹配分数掩盖的真实错误

近7日信号 1

论文OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

构建跨模态、跨学科的AI科学家系统,覆盖从假设生成到论文撰写的全科研流程自动化

近7日信号 1

论文AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

提出元harness优化框架,用于长周期智能体设计任务,强调模型-harness协同与人类设计先验对齐

近7日信号 1

论文AI's Economic Winners

外交关系委员会(CFR)报告,指出AI权力正从模型研发转向芯片、能源、关键矿产等供应链卡点

近7日信号 1

论文AI痕迹追踪简史

追溯AI生成内容统计特征的理论起源,从香农密码学洞见延伸至现代水印与检测技术

近7日信号 1

论文Effective context engineering for AI agents

Anthropic发布的关于AI智能体上下文工程的实践指南

近7日信号 1

论文How Organizations Use AI: Evidence from ChatGPT

基于ChatGPT企业版账户使用数据的实证研究,揭示组织级AI采纳模式、岗位分布、任务类型与财务绩效关联

近7日信号 2

论文AdvNav

首个在黑盒条件下对导航智能体进行系统性安全验证的框架

近7日信号 1

论文Claude一举扫清2000阶以下哈达玛矩阵

报道Claude模型在数学计算任务上的突破性进展,验证其推理能力

近7日信号 1

论文Budget-Dependent Rankings in LLM Evaluation

揭示LLM评测中生成token预算对模型排名的显著影响,挑战固定评测范式

近7日信号 1

论文NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

首个专注SPICE网表识别与操作的LLM可靠性评测基准,分离底层电路仿真接口能力与高层设计推理能力

近7日信号 1

论文Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge

揭示长上下文训练悖论:上下文扩展反而损害模型参数化知识保持能力,挑战当前长文本建模范式

近7日信号 1

论文SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

提出SCOUT框架,通过结构化思维链与多目标过程奖励提升视觉语言模型的空间推理鲁棒性,解决现有RL方法信用分配难题

近7日信号 1

论文VICBench: A Multi-Language Benchmark for Code Vulnerability Detection

首个支持多编程语言的漏洞检测评测基准,基于真实漏洞引入提交(VIC)构建,覆盖全链路安全评估场景

近7日信号 1

论文An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS

提出面向超算遗产代码现代化的智能体工作流,首次实现GAMESS量子化学软件两电子积分核心的自动化Fortran转现代语言重构

近7日信号 1

论文Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

首个面向科学图表理解的多模态评测基准,支持对MLLM在科研绘图、公式推导等专业场景能力的系统评估

近7日信号 1

论文Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

揭示技能型LLM智能体中第三方技能发布者可通过静态技能描述与指令体实施‘收敛绕道劫持’的安全漏洞

近7日信号 1

论文One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

发现多智能体强化学习中单一大语言模型模拟用户行为导致的‘模拟器崩溃’现象,并提出泛化失效归因分析

近7日信号 1

论文Structural Silence: When AI Infrastructure Fails Speakers of Underrepresented Languages

揭示AI基础设施(语料、分词、评估)对弱势语言使用者的系统性失效,提出结构性失语现象及其教育公平影响

近7日信号 1

论文VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

首个面向企业级智能体的多跳API+检索联合评测基准,填补工具调用策略下跨模态推理能力评估空白

近7日信号 1