提出轨迹感知评估法,显著降低软件工程智能体基准测试成本,保持高相关性
近7日信号 1 条
首次系统剖析LLM作为评判器在摘要评估中的内部打分机制,揭示其可解释性瓶颈
近7日信号 1 条
提出面向长周期智能体的实时追踪模型(live trace model),解决可观测性与上下文折叠难题
近7日信号 1 条
探讨大语言模型推理的效率边界与成本权衡
近7日信号 1 条
面向子群体感知的生成增强方法,缓解数据偏置导致的虚假相关
近7日信号 1 条
基于推测解码骨干网络的LLM输出长度预测方法,解决服务资源调度难题
近7日信号 1 条
提出LLM-as-a-judge后对齐方法,使其输出分布匹配人类判断分布而非单点标签
近7日信号 1 条
探究提示对代码生成的辅助作用是否蕴含技能迁移,使用可执行评测验证知识内化程度
近7日信号 1 条
首个支持溯源验证的纵向临床推理评测基准,基于电子病历衍生对话构建
近7日信号 1 条
提出在冻结LLM连续表征空间中进行潜变量循环精炼的推理范式,规避离散token链式错误传播
近7日信号 1 条
提出递归LLM智能体树的风险渐进式释放机制,平衡分支扩展与工具调用权限控制
近7日信号 1 条
提出基于用户画像的LLM智能体A/B测试仿真框架,替代真实流量实验
近7日信号 1 条
首个面向多语言智能体的文化感知基准,覆盖状态保持、多语种性能与真实场景适配
近7日信号 1 条
提出基于评分标准的强化学习框架ARISE-RL,解决开放型智能体长周期任务训练中缺乏可验证答案与可扩展评分标准的难题
近7日信号 1 条
提出对比式路由机制,解决MoE中专家专业化受限问题,提升模块化专家路由效果
近7日信号 1 条
首次系统评估编码智能体工作记忆的异构性,提出多维评测框架,涵盖指令、产物、工具输出与自生成状态等不同语义角色的记忆行为
近7日信号 1 条
发现并量化LLM推理链中的‘读出间隙’,证明失败预测未必反映能力缺失
近7日信号 1 条
探索基于可验证奖励的强化学习(RLVR)向数学与代码之外领域扩展的路径,指向超级智能
近7日信号 1 条
将工业级大模型后训练类比为棕地维护,提出数据工程视角下的增量优化范式
近7日信号 1 条
提出BLOOM-WILT方法,通过logit倾斜技术在自动化LLM审计中激发部署中罕见但关键的行为
近7日信号 1 条
揭示高效评估方法可能导致负责任AI基准结论失稳,强调计算成本削减对评估鲁棒性的潜在影响
近7日信号 1 条
提出四阶段黑盒身份验证协议,应对AI模型匿名发布带来的数据治理、供应链风险与能力预期不确定性问题
近7日信号 1 条
提出上下文感知交错批处理方法,解决WhisperX因音频分段隔离导致标点与术语连贯性下降的问题
近7日信号 1 条
构建ElephantBench评测集,首次系统探测LLM在长尾歧义知识下的认知盲区
近7日信号 2 条
首次在范式层面开展In-context Learning文本到SQL任务的精度-成本权衡分析,揭示复杂流水线的实际增益边界
近7日信号 1 条
揭示结构化输出约束可能静默禁用工具调用,提出基于调度层仪器化的智能体数据表抽取诊断框架
近7日信号 1 条
研究基于强化学习的计算器工具调用机制,提升大语言模型在数学推理中对外部工具的可靠集成能力
近7日信号 1 条
提出COVER评估协议,可识别多智能体团队变更引发的路由效应,而非仅依赖端到端准确率差异
近7日信号 1 条
提出基于细粒度强化学习的上下文管理教学框架ContextPilot,解决长程智能体任务中工作记忆持续膨胀问题
近7日信号 1 条
首个面向AlphaGeometry的自然语言到形式化数学问题自动转换评测基准
近7日信号 1 条