AI商业灯塔
论文Cliff: Learning Process Rewards from the First Mistake

提出从首次错误中学习过程奖励的RLVR新范式,提升LLM推理过程引导能力

近7日信号 1

论文UE5M3 FP4 Block Scaling for Stable Language Model Pretraining

提出UE5M3 FP4块缩放方法,解决4位浮点预训练稳定性难题

近7日信号 1

论文Post-Training Language Models for Gold-Medal Performance in Coding Competitions

提出端到端特化流水线,使LLM在IOI/ICPC等编程竞赛中达到金牌水平

近7日信号 1

论文The Implications of Linguistic Illegibility for LLM Security

揭示LLM输出与内部机制间语言不可读性对安全评估构成根本挑战

近7日信号 1

论文User Feedback Provides a Unique Signal that LLMs Can not Detect

论证用户反馈是LLM无法内生感知的独特学习信号,挑战现有反馈利用范式

近7日信号 1

论文Towards Trustworthy Autonomous Robots: An Explainable AI-Based Decision Framework

提出TRACE可解释推理框架,解决自主机器人决策不可审计问题

近7日信号 1

论文Graph Machine: Towards Better Pretraining via Edges

提出Graph Machine架构,通过动态稀疏路由维持O(n)状态复杂度,改进图结构预训练

近7日信号 1

论文Discriminative World Models for Web Agents

提出面向网页代理的判别式世界模型,通过预测动作后状态并排序提升测试时决策质量

近7日信号 1

论文Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents

提出将防御能力封装为可动态演化的运行时技能,增强技能增强型智能体安全性

近7日信号 1

论文GlossoGen: Emergent Language in Complex Multi-Agent LLM Interactions

研究多LLM智能体复杂交互中涌现语言的生成机制与安全影响

近7日信号 1

论文LatentPress: Context Compression Beyond Text and Vision

提出LatentPress,将对话与长文档压缩为语言模型可直接消费的隐空间表示

近7日信号 1

论文TempCloze: Can Video-LLMs Identify the Missing Middle?

提出TempCloze视频完形填空基准,专用于评测视频大模型对时间中间帧的识别能力

近7日信号 1

论文When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation

揭示LLM智能体商业仿真评估中护栏有效性表象下的构念效度失效问题

近7日信号 1

论文EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation

提出EvoSCM框架,通过因果模型演化与实验实现科学信念的显式建模与可验证修订

近7日信号 1

论文NashDreamer: Model-Based Reinforcement Learning for Zero-Sum Imperfect-Information Games

提出NashDreamer框架,首次将模型驱动强化学习成功应用于零和不完全信息博弈

近7日信号 1

论文Can LLMs Discover Scientific Laws in Real and Parallel Worlds?

探索LLM在真实世界与平行世界数据上发现科学定律的能力边界与泛化机制

近7日信号 1

论文Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories

首次在数学竞赛与智能体轨迹两个领域实证表面形式偏差对结构化检索的影响

近7日信号 1

论文H3-World: Turning Language Understanding into World Control

将MiniMax-H3视频生成模型转化为交互式世界模型H3-World,验证语言作为世界控制接口的可行性

近7日信号 1

论文From Confusion to Clarity: Confusion-Aware Retrieval and Knowledge Injection for Text Classification

提出困惑感知检索与知识注入方法,提升细粒度文本分类在大规模语义相近标签下的准确率

近7日信号 1

论文Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

利用熵值选择性引导智能体策略学习,缓解VLM教师模型昂贵且僵化的缺陷

近7日信号 1

论文From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix

提出基于企业真实请求混合流量的自托管LLM构建方法,解决多代模型碎片化GPU资源问题

近7日信号 1

论文Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

建立从小模型到大模型可扩展的SFT与RL标注预算最优分配理论框架

近7日信号 1

论文Closing Cost-Quality Gap in Document VLMs: Difficulty-Aware Data Curation and Quality-Adjusted Deployment Economics

提出面向文档理解VLM的难度感知数据策展与质量-成本协同部署方法,适配金融等强监管行业

近7日信号 1

论文The Structure of Quantization Damage in LLMs: Why the Next Bit Should Be Spent Globally

揭示大模型量化损伤的空间分布规律,提出全局比特分配优于局部调优的新洞见

近7日信号 1

论文Designing Proactive Thought Partners for Writing

系统探讨写作场景中主动式AI协作者的设计原则,超越通用提示生成

近7日信号 1

论文Mechanism Design for Alignment and Control

构建面向未知对齐状态与能力边界的AI智能体的机制设计框架,兼顾诚实性与服从性激励

近7日信号 1

论文Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

发布首个面向接触密集型精密操作的机器人基础模型Facet-0,聚焦亚毫米级装配鲁棒性

近7日信号 1

论文The Rise of Verbal Reinforcement Learning

提出“语言强化学习(Verbal RL)”新范式,将自然语言作为人机协同反馈主通道

近7日信号 1

论文CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?

构建首个面向动态智能体运行时(Dynamic Agent Harness)的组件生命周期推理评测基准CordisBench(1200题)

近7日信号 1

论文Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation

针对超长代码库场景,提出关键Token自适应检索方法,缓解LLM上下文长度限制

近7日信号 1