AI商业灯塔
论文Should We Type or Talk to LLM Agents?

首次系统对比语音与键盘输入对LLM智能体性能影响,量化两种通道的噪声特征差异

近7日信号 1

论文ReflectRL

提出基于黄金负轨迹的反思到直接推理方法,提升策略训练鲁棒性

近7日信号 1

论文Video-DeepResearch

提出首个面向连续视频流的多模态深度研究智能体Video-DR,支持密集时空定位与开放网络探索

近7日信号 1

论文When Attention Goes Blind

首次揭示ALiBi位置编码在线性偏置缩放中因浮点下溢导致注意力头部分失效的数值缺陷

近7日信号 1

论文Agogic

提出面向LLM原生文本到符号音乐生成的性能定时音乐token化方案

近7日信号 1

论文Test-Time Scaling in Reasoning LLMs

系统梳理推理型大语言模型测试时扩展的推理范式、评估方法与可复现性挑战

近7日信号 1

论文PAST-Bench

首个专为个人智能体递归自我改进能力设计的基准,聚焦经验转化为行为优化的闭环机制

近7日信号 1

论文TurnSight

提出逐轮回溯自蒸馏方法,提升工具集成型推理中细粒度信用分配能力

近7日信号 1

论文WorldCup Arena

首个前瞻性、防泄露的实时赛事预测评测框架,用于前沿大语言模型的动态预测能力评估

近7日信号 1

论文SocietyBench

首个面向社会世界反事实演化的预测基准,评估LLM及智能体对社会动态的理解与推演能力

近7日信号 1

论文ParVL

提出并行扩展与可伸缩计算分配框架,解决多模态大语言模型(MLLM)参数扩展与推理计算扩展间的内存/延迟权衡问题

近7日信号 1

论文When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

系统性研究AI基准测试饱和现象的论文,揭示当前评估方法局限性与改进方向

近7日信号 1

论文Unit Distance Conjecture refutation by GPT-5.6 Pro

声称GPT-5.6 Pro给出反例但被数学家24小时内证伪的论文事件

近7日信号 1

论文Real-Time Detection and Repair of LLM Agent Failures

提出实时检测与修复LLM智能体失败的新方法,避免二次LLM判别带来的高成本

近7日信号 1

论文Grounding Agentic VLMs with Dedicated Segmentation

针对细粒度车辆损伤评估任务,提出专用分割模块增强视觉语言模型的空间接地能力

近7日信号 1

论文CTRAG: In-Context Retrieval-based Framework for Automated Compliance Checking

提出基于上下文检索的自动化合规检查框架CTRAG,利用大模型提升监管生态信任度

近7日信号 1

论文Cultural Awareness is Represented but Not Decoded

实证分析18个开源大模型对全球神话知识的表征与解码能力落差,揭示文化默认偏见机制

近7日信号 1

论文Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions

倡导并初步构建人类-AI交互的纵向研究范式,关注认知、发展与社会层面的长期影响

近7日信号 1

论文SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

首个支持用户实时介入代码的编码智能体评测基准,模拟真实协作开发场景

近7日信号 1

论文CMuon: Accelerating and Stabilizing Diffusion Transformer Training

通过分块动量正交化技术加速并稳定扩散Transformer训练,降低DiT模型训练成本

近7日信号 1

论文Abduction Without a Body? Representational Grounding and the Abduction Loop

探讨科学溯因是否必须依赖具身感知,提出脱离物理耦合的表征性溯因循环理论框架

近7日信号 1

论文RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory

提出Reduced-Order Utility States机制,在自进化智能体记忆中平衡反馈覆盖率与记忆-奖励陷阱

近7日信号 1

论文LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference

为长时运行大模型智能体设计持久化内存状态连续性机制,解决交互流超出上下文窗口的根本挑战

近7日信号 1

论文Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation

通过监测跨会话能力累积效应检测AI滥用,针对多智能体协同架构提出新型风险监控范式

近7日信号 1

论文Analytic Planning under Uncertainty with Moment Closure

提出基于矩闭合的解析规划方法,在随机环境中实现对预测不确定性的严格建模与传播

近7日信号 1

论文MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

首个面向医患高压对话场景的多轮基准测试,评估大模型在患者压力诱导下的医疗谄媚倾向

近7日信号 1

论文Uncertainty Is Not Enough: Value-of-Information Routing for Mixtures of LoRA Experts

提出基于信息价值(VoI)的LoRA专家路由机制,突破仅依赖不确定性判断的局限,提升参数高效混合专家系统决策质量

近7日信号 1

论文A Taxonomy of Cognitive Capability Gaps in Generative and Agentic AI

系统性构建生成式与智能体AI的认知能力缺口分类体系,涵盖持续推理、自适应行为、持久记忆与自我调节四大维度

近7日信号 1

论文Structured Memory for Edge Language Models

针对边缘端大模型提出O(1)状态注入的结构化记忆机制,解决RAG预填充开销与Transformer KV缓存膨胀问题

近7日信号 1

论文AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies

面向数据中心控制平面策略生成的智能体化原则性框架,聚焦于解决硬件-软件栈复杂、设计空间庞大及策略原型周期长等工程瓶颈

近7日信号 1