AI商业灯塔
论文Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation

提出轨迹感知评估法,显著降低软件工程智能体基准测试成本,保持高相关性

近7日信号 1

论文Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation

首次系统剖析LLM作为评判器在摘要评估中的内部打分机制,揭示其可解释性瓶颈

近7日信号 1

论文Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers

提出面向长周期智能体的实时追踪模型(live trace model),解决可观测性与上下文折叠难题

近7日信号 1

论文The efficient frontier of LLM inference

探讨大语言模型推理的效率边界与成本权衡

近7日信号 1

论文SAGE: Subpopulation-Aware Generative Enhancement

面向子群体感知的生成增强方法,缓解数据偏置导致的虚假相关

近7日信号 1

论文OUTLETS: Output-Length Prediction from Speculative Decoding Backbones

基于推测解码骨干网络的LLM输出长度预测方法,解决服务资源调度难题

近7日信号 1

论文Post-hoc Alignment of LLM-judges to Human Judgment Distribution

提出LLM-as-a-judge后对齐方法,使其输出分布匹配人类判断分布而非单点标签

近7日信号 1

论文Hints Help But Do They Teach? Evaluating Skills Transfer in Code Generation

探究提示对代码生成的辅助作用是否蕴含技能迁移,使用可执行评测验证知识内化程度

近7日信号 1

论文ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues

首个支持溯源验证的纵向临床推理评测基准,基于电子病历衍生对话构建

近7日信号 1

论文Latent Recurrent Thoughts: Recurrent Refinement of Proposed Latents for Reasoning with Frozen LLMs

提出在冻结LLM连续表征空间中进行潜变量循环精炼的推理范式,规避离散token链式错误传播

近7日信号 1

论文Spawn Freely, Act Sparingly: Progressive Risk Vesting for Recursive LLM-Agent Trees

提出递归LLM智能体树的风险渐进式释放机制,平衡分支扩展与工具调用权限控制

近7日信号 1

论文Data-Driven Persona-Conditioned Agents for A/B Test Simulation

提出基于用户画像的LLM智能体A/B测试仿真框架,替代真实流量实验

近7日信号 1

论文WorldBench: Culturally Grounded Benchmark for Multilingual Agents

首个面向多语言智能体的文化感知基准,覆盖状态保持、多语种性能与真实场景适配

近7日信号 1

论文ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

提出基于评分标准的强化学习框架ARISE-RL,解决开放型智能体长周期任务训练中缺乏可验证答案与可扩展评分标准的难题

近7日信号 1

论文Beyond Magnitude: Contrastive Routing for Modular Mixture-of-Experts

提出对比式路由机制,解决MoE中专家专业化受限问题,提升模块化专家路由效果

近7日信号 1

论文Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents

首次系统评估编码智能体工作记忆的异构性,提出多维评测框架,涵盖指令、产物、工具输出与自生成状态等不同语义角色的记忆行为

近7日信号 1

论文Wrong Prediction, Right Answer

发现并量化LLM推理链中的‘读出间隙’,证明失败预测未必反映能力缺失

近7日信号 1

论文Scaling Large Reasoning Models beyond Human Supervision

探索基于可验证奖励的强化学习(RLVR)向数学与代码之外领域扩展的路径,指向超级智能

近7日信号 1

论文LLM Post-Training as Brownfield Maintenance

将工业级大模型后训练类比为棕地维护,提出数据工程视角下的增量优化范式

近7日信号 1

论文BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing

提出BLOOM-WILT方法,通过logit倾斜技术在自动化LLM审计中激发部署中罕见但关键的行为

近7日信号 1

论文Stress-Testing Efficient Responsible-AI Evaluation

揭示高效评估方法可能导致负责任AI基准结论失稳,强调计算成本削减对评估鲁棒性的潜在影响

近7日信号 1

论文Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification

提出四阶段黑盒身份验证协议,应对AI模型匿名发布带来的数据治理、供应链风险与能力预期不确定性问题

近7日信号 1

论文Context-Aware Interleaved Batching for WhisperX

提出上下文感知交错批处理方法,解决WhisperX因音频分段隔离导致标点与术语连贯性下降的问题

近7日信号 1

论文Blind Men and the Elephant

构建ElephantBench评测集,首次系统探测LLM在长尾歧义知识下的认知盲区

近7日信号 2

论文Are These Modules Worth Their Cost? A Paradigm-Level Accuracy-Cost Analysis of In-context Learning Text-to-SQL

首次在范式层面开展In-context Learning文本到SQL任务的精度-成本权衡分析,揭示复杂流水线的实际增益边界

近7日信号 1

论文Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction

揭示结构化输出约束可能静默禁用工具调用,提出基于调度层仪器化的智能体数据表抽取诊断框架

近7日信号 1

论文Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning

研究基于强化学习的计算器工具调用机制,提升大语言模型在数学推理中对外部工具的可靠集成能力

近7日信号 1

论文COVER: Identifiable Evaluation of Coalition Routing

提出COVER评估协议,可识别多智能体团队变更引发的路由效应,而非仅依赖端到端准确率差异

近7日信号 1

论文ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

提出基于细粒度强化学习的上下文管理教学框架ContextPilot,解决长程智能体任务中工作记忆持续膨胀问题

近7日信号 1

论文NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometry

首个面向AlphaGeometry的自然语言到形式化数学问题自动转换评测基准

近7日信号 1