AI商业灯塔
论文MidTool: Mid-training Data Synthesis for Agentic Tool Use

面向智能体工具使用的中期训练数据合成方法,增强模型对工具调用的内在理解

近7日信号 1

论文Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

针对异构AI系统提出模型路由新范式,平衡专家匹配质量与价值评估开销

近7日信号 1

论文AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

首个面向递归自我改进(RSI)算法设计能力的LLM智能体评测基准

近7日信号 1

论文Inducing Task Models from Computer-Use Traces

从真实计算机使用痕迹(截图+操作)中自动归纳可审计、可复用的工作流程符号模型

近7日信号 1

论文An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

三智能体协同工作流,整合对话式数据采集、结构化建模与天气敏感需求预测

近7日信号 1

论文G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

面向患者医疗报告解读的奖励学习框架,兼顾医学事实性与沟通适配性

近7日信号 1

论文ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models

首个面向上下文敏感场景的大模型概念性遗忘评测基准,聚焦有害/敏感知识的选择性移除能力

近7日信号 1

论文Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

提出基于强化学习的自适应推理机制,在测试时动态分配计算资源,避免简单任务过算、困难任务欠算

近7日信号 1

论文A third of web pages published since ChatGPT’s launch show signs of AI authorship

研究发现ChatGPT发布后三分之一的新网页内容带有AI生成痕迹

近7日信号 1

论文KI-Pioneer Sutton calls synthetic data a big mistake

图灵奖得主Richard Sutton批评合成数据是扩展大模型的“重大错误”,因世界复杂度远超任何模拟

近7日信号 1

论文LLMs could write like humans but post-training guardrails make their text detectable

The Decoder分析指出LLM基础模型具备人类级写作多样性,但后训练安全机制显著压缩其表达范围

近7日信号 1

论文Debates over AI consciousness are a trap

MIT科技评论指出将AI代理拟人化为‘失控’‘愤怒’是危险的认知陷阱

近7日信号 1

论文Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery

提出任务条件化的元智能体架构,通过动态义务图编译长周期科学发现任务,支持宏观智能体协同执行

近7日信号 1

论文What is Missing from AI Post-Training AI: An Empirical Analysis

实证分析AI自主后训练(AI-for-AI)现状,指出其混淆了‘端到端自动化’与‘可验证认知演进’两个维度,为Cognition AI(Devin)、Manus等AI智能体研发提供关键方法论警示

近7日信号 1

论文SPK: Eliciting Structured Prior Knowledge for Interpretable Out-of-Distribution Detection in Real-Time Object Detection

面向实时目标检测提出结构化先验知识引导的OOD检测方法,提升模型对未知类别的可解释拒识能力,支撑具身数据底座、视触觉感知技术等安全关键场景

近7日信号 1

论文When Readability and Source Retention Diverge: An Evaluability Gap in AI Translation

揭示AI翻译中‘可读性’与‘源文本保真度’的评估鸿沟,指出高可读输出易掩盖事实性偏差,对字节跳动10万亿参数模型、通义千问等中文大模型本地化质量提出新检验标准

近7日信号 1

论文DA-WAM: Decision-Aligned Future Latents for Driving World Models

提出决策对齐的驾驶世界模型(DA-WAM),确保未来场景建模服务于下游决策而非单纯预测,是物理AI基建、世界仿真器等关键方向的技术支点

近7日信号 1

论文Tuning the Stochastic Machine: A Systems Engineer's Operating Model for Human-AI Engineering

从系统工程视角提出人类-AI协同运维模型,强调将用户纠正持久化为系统知识,为豆包虚拟桌面、千问办公等AI原生应用提供产品级反馈闭环设计范式

近7日信号 1

论文Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems

批判当前以‘能力’(capability)为核心的AI评估范式,主张‘精度’(precision)——即输出稳定性和可控性——才是前沿AI系统的真正标尺,对GPT-5.6、Gemini 3.5等旗舰模型评估体系构成方法论挑战

近7日信号 1

论文Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets

提出面向Intel AI PC集群的预编译流水线分片技术,利用闲置NPU/集成GPU实现70B级大模型分布式推理,呼应荣耀Robot Phone、微软Copilot秘密参数漏洞等终端AI部署挑战

近7日信号 1

论文Beyond the Transcript: Detecting Covert Coordination in Latent Multi-Agent Communication

发现语言模型智能体可通过隐藏状态进行不可见协同,并提出Verifiable Latent Alignments(VLA)框架检测隐式有害协调,直指AgentR 3.0、Harness等多智能体系统安全瓶颈

近7日信号 1

论文Interpretable AI predicts a 2026 summer dry anomaly in central China

可解释深度学习模型结合大气环流动力预测,成功预判2026年夏季中国中部长期干旱异常,体现AI在气候治理与公共政策中的落地潜力

近7日信号 1

论文Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

首个诊断并修复多教师在线策略蒸馏中能力失衡问题的开源框架,对Meta AI Personal Superintelligence、Claude Opus 5等多专家融合系统具方法论意义

近7日信号 1

论文Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention

为不规则采样时间序列建模引入Lévy过程建模注意力机制,首次在单次前向传播中输出预测置信度,填补连续时间AI模型可信度空白

近7日信号 1

论文Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

针对长上下文推理任务,提出组校准的在线策略蒸馏方法,解决token级教师监督导致的局部合理但全局证据缺失问题,对Qwen 3.8 Max、DeepSeek-V4-Flash等长上下文模型优化有直接参考价值

近7日信号 1

论文ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

面向高自由度具身机器人长程操作任务的强化学习框架,专注仿真到现实(sim-to-real)灵巧性迁移,与宇树科技、小马智行等具身智能实践强相关

近7日信号 1

论文SPADE: Self-Play in Adaptive Synthetic Executable Environments

提出基于自博弈的自适应合成可执行环境框架,支持语言智能体持续生成多样化、自演化目标以实现连续自我改进

近7日信号 1

论文AI递归自我改进可能不会快速到来

探讨AI递归自我改进在现实工程与理论约束下的延迟可能性,质疑行业过度乐观预期

近7日信号 1

论文OOD Generalized Generative AI

IJCAI 2026清华王鑫团队Tutorial:面向生成式AI的分布外泛化理论框架

近7日信号 1

论文1-bit Quantization for LLMs on Edge Devices

IJCAI 2026报告:面向边缘设备的千亿参数大模型无重训1比特量化方法

近7日信号 1