提出从首次错误中学习过程奖励的RLVR新范式,提升LLM推理过程引导能力
近7日信号 1 条
提出UE5M3 FP4块缩放方法,解决4位浮点预训练稳定性难题
近7日信号 1 条
提出端到端特化流水线,使LLM在IOI/ICPC等编程竞赛中达到金牌水平
近7日信号 1 条
揭示LLM输出与内部机制间语言不可读性对安全评估构成根本挑战
近7日信号 1 条
论证用户反馈是LLM无法内生感知的独特学习信号,挑战现有反馈利用范式
近7日信号 1 条
提出TRACE可解释推理框架,解决自主机器人决策不可审计问题
近7日信号 1 条
提出Graph Machine架构,通过动态稀疏路由维持O(n)状态复杂度,改进图结构预训练
近7日信号 1 条
提出面向网页代理的判别式世界模型,通过预测动作后状态并排序提升测试时决策质量
近7日信号 1 条
提出将防御能力封装为可动态演化的运行时技能,增强技能增强型智能体安全性
近7日信号 1 条
研究多LLM智能体复杂交互中涌现语言的生成机制与安全影响
近7日信号 1 条
提出LatentPress,将对话与长文档压缩为语言模型可直接消费的隐空间表示
近7日信号 1 条
提出TempCloze视频完形填空基准,专用于评测视频大模型对时间中间帧的识别能力
近7日信号 1 条
揭示LLM智能体商业仿真评估中护栏有效性表象下的构念效度失效问题
近7日信号 1 条
提出EvoSCM框架,通过因果模型演化与实验实现科学信念的显式建模与可验证修订
近7日信号 1 条
提出NashDreamer框架,首次将模型驱动强化学习成功应用于零和不完全信息博弈
近7日信号 1 条
探索LLM在真实世界与平行世界数据上发现科学定律的能力边界与泛化机制
近7日信号 1 条
首次在数学竞赛与智能体轨迹两个领域实证表面形式偏差对结构化检索的影响
近7日信号 1 条
将MiniMax-H3视频生成模型转化为交互式世界模型H3-World,验证语言作为世界控制接口的可行性
近7日信号 1 条
提出困惑感知检索与知识注入方法,提升细粒度文本分类在大规模语义相近标签下的准确率
近7日信号 1 条
利用熵值选择性引导智能体策略学习,缓解VLM教师模型昂贵且僵化的缺陷
近7日信号 1 条
提出基于企业真实请求混合流量的自托管LLM构建方法,解决多代模型碎片化GPU资源问题
近7日信号 1 条
建立从小模型到大模型可扩展的SFT与RL标注预算最优分配理论框架
近7日信号 1 条
提出面向文档理解VLM的难度感知数据策展与质量-成本协同部署方法,适配金融等强监管行业
近7日信号 1 条
揭示大模型量化损伤的空间分布规律,提出全局比特分配优于局部调优的新洞见
近7日信号 1 条
系统探讨写作场景中主动式AI协作者的设计原则,超越通用提示生成
近7日信号 1 条
构建面向未知对齐状态与能力边界的AI智能体的机制设计框架,兼顾诚实性与服从性激励
近7日信号 1 条
发布首个面向接触密集型精密操作的机器人基础模型Facet-0,聚焦亚毫米级装配鲁棒性
近7日信号 1 条
提出“语言强化学习(Verbal RL)”新范式,将自然语言作为人机协同反馈主通道
近7日信号 1 条
构建首个面向动态智能体运行时(Dynamic Agent Harness)的组件生命周期推理评测基准CordisBench(1200题)
近7日信号 1 条
针对超长代码库场景,提出关键Token自适应检索方法,缓解LLM上下文长度限制
近7日信号 1 条