针对扩散型大语言模型(DLLMs)的机制化安全漏洞挖掘与对抗研究
近7日信号 1 条
面向视觉语言模型的压力测试可扩展自动化基准框架
近7日信号 1 条
面向可靠假设检验训练的LLM智能体强化学习方法
近7日信号 1 条
引入情感敏感性与冲突感知记忆的LLM智能体认知架构
近7日信号 1 条
面向智能体编程的预测性内存管理层,解决上下文与代码通道耦合下的token浪费问题
近7日信号 1 条
面向企业级LLM部署的开源AI风险缓解工具分类学分析
近7日信号 1 条
通过邻近文本梯度下降实现LLM智能体技能自演化的轻量级方法
近7日信号 1 条
揭示AI智能体交互引发非平衡态动态行为的物理机制
近7日信号 1 条
面向长上下文RAG的上下文化信息单元KV缓存复用机制
近7日信号 1 条
可扩展地教导LLM平衡质量、创造力与多样性输出的指令微调方法
近7日信号 1 条
面向镜面反射生成的视频扩散模型优化方法
近7日信号 1 条
面向波动时序预测的混沌门控Quantformer框架
近7日信号 1 条
融合生成式AI、LaTeX与Python的STEM教学设计六阶段架构
近7日信号 1 条
基于欧洲多国调查的LLM价值对齐社会决定因素解耦分析
近7日信号 1 条
面向科研问答的多阶段 grounding 与验证基准
近7日信号 1 条
首次量化AI智能体推理能耗是基础聊天提示的600倍
近7日信号 1 条
提出长程代理轨迹的错误生命周期追踪方法,精准定位导致级联失败的关键初始错误步骤
近7日信号 2 条
提出时间步条件化Transformer架构,突破传统固定步长限制实现全球天气预报精度与效率平衡
近7日信号 1 条
提出DASH方法,通过发散自适应监督范围提升推理模型的在线策略自蒸馏效果
近7日信号 1 条
研究在效用约束下提升合成临床基准的真实性,解决医疗AI代理测试中因数据敏感导致的结构性失真问题
近7日信号 1 条
对“图像思维”范式开展因果审计,发现视觉裁剪缩放等主动操作常带来边际或负向收益,质疑其实际效用
近7日信号 1 条
提出基于克罗内克分解海森矩阵的高效量化方法,加速GPTQ类自适应舍入算法
近7日信号 1 条
融合神经与符号方法的RAG架构,提升问答过程的可解释性,显式呈现中间推理步骤与知识溯源
近7日信号 1 条
提出无监督的在策略自蒸馏方法,摆脱对真实标签、环境反馈或人工指导的依赖,实现纯LLM内生优化
近7日信号 1 条
提出首个聚焦LLM“运行时外壳”(harness)优化能力的评测基准,涵盖提示、工具、控制流等系统级组件
近7日信号 1 条
主张用可解释的代理式操作替代黑盒Top-K检索,在财报、审计报告等结构化长文档场景中提升RAG透明度与可控性
近7日信号 1 条
提出基于排序的奖励构造方法,释放生成式奖励模型在LLM强化学习中的潜力,突破判别式模型瓶颈
近7日信号 1 条
构建面向中国国标文档(GB/T)的规则密集型审查评测基准,填补LLM在专业合规审查能力评估空白
近7日信号 1 条
首次系统评估对话代理基准质量,指出其普遍存在任务不一致、场景简化、策略覆盖不足等问题
近7日信号 1 条
提出交互式神经符号框架,从关系型数据中自动构建分析语义模式,支持自然语言查询与报告生成
近7日信号 1 条