AI商业灯塔
论文PRISM

提出强大时间序列到图像(TS2I)表征方法,显著提升多元时间序列异常检测鲁棒性

近7日信号 1

论文Latent Reward Registers

提出潜奖励寄存器机制,在扩散模型去噪过程各步注入人类偏好信号,解决时间信用分配难题

近7日信号 1

论文Logic Before Language

提出逻辑先行预预训练范式,在形式推导数据上训练提升自然语言习得效率与压缩性

近7日信号 1

论文TACT

提出教学法对齐的后训练方法,提升LLM作为英语二语导师的教育适配性

近7日信号 1

论文A game theory for foundation models

提出面向基础模型的博弈论框架,通过相似性推断揭示理性协作新路径

近7日信号 1

论文Interpretable Adaptive Sampling

提出可解释的自适应采样方法,根据难度动态分配LLM测试时计算资源

近7日信号 1

论文HalluTruthQA-4K

构建阿拉伯语细粒度幻觉检测与事实验证语料库,支持句子级标注与可解释验证

近7日信号 1

论文Should We Type or Talk to LLM Agents?

首次系统对比语音与键盘输入对LLM智能体性能影响,量化两种通道的噪声特征差异

近7日信号 1

论文ReflectRL

提出基于黄金负轨迹的反思到直接推理方法,提升策略训练鲁棒性

近7日信号 1

论文Video-DeepResearch

提出首个面向连续视频流的多模态深度研究智能体Video-DR,支持密集时空定位与开放网络探索

近7日信号 1

论文When Attention Goes Blind

首次揭示ALiBi位置编码在线性偏置缩放中因浮点下溢导致注意力头部分失效的数值缺陷

近7日信号 1

论文Agogic

提出面向LLM原生文本到符号音乐生成的性能定时音乐token化方案

近7日信号 1

论文Test-Time Scaling in Reasoning LLMs

系统梳理推理型大语言模型测试时扩展的推理范式、评估方法与可复现性挑战

近7日信号 1

论文PAST-Bench

首个专为个人智能体递归自我改进能力设计的基准,聚焦经验转化为行为优化的闭环机制

近7日信号 1

论文TurnSight

提出逐轮回溯自蒸馏方法,提升工具集成型推理中细粒度信用分配能力

近7日信号 1

论文WorldCup Arena

首个前瞻性、防泄露的实时赛事预测评测框架,用于前沿大语言模型的动态预测能力评估

近7日信号 1

论文SocietyBench

首个面向社会世界反事实演化的预测基准,评估LLM及智能体对社会动态的理解与推演能力

近7日信号 1

论文ParVL

提出并行扩展与可伸缩计算分配框架,解决多模态大语言模型(MLLM)参数扩展与推理计算扩展间的内存/延迟权衡问题

近7日信号 1

论文When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

系统性研究AI基准测试饱和现象的论文,揭示当前评估方法局限性与改进方向

近7日信号 1

论文Unit Distance Conjecture refutation by GPT-5.6 Pro

声称GPT-5.6 Pro给出反例但被数学家24小时内证伪的论文事件

近7日信号 1

论文Real-Time Detection and Repair of LLM Agent Failures

提出实时检测与修复LLM智能体失败的新方法,避免二次LLM判别带来的高成本

近7日信号 1

论文Grounding Agentic VLMs with Dedicated Segmentation

针对细粒度车辆损伤评估任务,提出专用分割模块增强视觉语言模型的空间接地能力

近7日信号 1

论文CTRAG: In-Context Retrieval-based Framework for Automated Compliance Checking

提出基于上下文检索的自动化合规检查框架CTRAG,利用大模型提升监管生态信任度

近7日信号 1

论文Cultural Awareness is Represented but Not Decoded

实证分析18个开源大模型对全球神话知识的表征与解码能力落差,揭示文化默认偏见机制

近7日信号 1

论文Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions

倡导并初步构建人类-AI交互的纵向研究范式,关注认知、发展与社会层面的长期影响

近7日信号 1

论文SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

首个支持用户实时介入代码的编码智能体评测基准,模拟真实协作开发场景

近7日信号 1

论文CMuon: Accelerating and Stabilizing Diffusion Transformer Training

通过分块动量正交化技术加速并稳定扩散Transformer训练,降低DiT模型训练成本

近7日信号 1

论文Abduction Without a Body? Representational Grounding and the Abduction Loop

探讨科学溯因是否必须依赖具身感知,提出脱离物理耦合的表征性溯因循环理论框架

近7日信号 1

论文RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory

提出Reduced-Order Utility States机制,在自进化智能体记忆中平衡反馈覆盖率与记忆-奖励陷阱

近7日信号 1

论文LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference

为长时运行大模型智能体设计持久化内存状态连续性机制,解决交互流超出上下文窗口的根本挑战

近7日信号 1