AI商业灯塔
论文Diffusion LLMs as Targets and Adversaries

针对扩散型大语言模型(DLLMs)的机制化安全漏洞挖掘与对抗研究

近7日信号 1

论文SABRE

面向视觉语言模型的压力测试可扩展自动化基准框架

近7日信号 1

论文Fisher-R1

面向可靠假设检验训练的LLM智能体强化学习方法

近7日信号 1

论文PsychoAgent

引入情感敏感性与冲突感知记忆的LLM智能体认知架构

近7日信号 1

论文Blast Radius

面向智能体编程的预测性内存管理层,解决上下文与代码通道耦合下的token浪费问题

近7日信号 1

论文Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

面向企业级LLM部署的开源AI风险缓解工具分类学分析

近7日信号 1

论文SkillProx

通过邻近文本梯度下降实现LLM智能体技能自演化的轻量级方法

近7日信号 1

论文Interaction Creates Dynamical AI Behavior

揭示AI智能体交互引发非平衡态动态行为的物理机制

近7日信号 1

论文CoinRAG

面向长上下文RAG的上下文化信息单元KV缓存复用机制

近7日信号 1

论文CreativeInstruct

可扩展地教导LLM平衡质量、创造力与多样性输出的指令微调方法

近7日信号 1

论文MirrorWorld

面向镜面反射生成的视频扩散模型优化方法

近7日信号 1

论文QFCQT

面向波动时序预测的混沌门控Quantformer框架

近7日信号 1

论文Curriculum as Code

融合生成式AI、LaTeX与Python的STEM教学设计六阶段架构

近7日信号 1

论文People Are Not Just Their Countries

基于欧洲多国调查的LLM价值对齐社会决定因素解耦分析

近7日信号 1

论文LitTraceQA

面向科研问答的多阶段 grounding 与验证基准

近7日信号 1

论文AI agents use roughly 600 times more energy than a simple chat prompt

首次量化AI智能体推理能耗是基础聊天提示的600倍

近7日信号 1

论文TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

提出长程代理轨迹的错误生命周期追踪方法,精准定位导致级联失败的关键初始错误步骤

近7日信号 2

论文Timestep-Conditioned Transformers for Global Weather Forecasting

提出时间步条件化Transformer架构,突破传统固定步长限制实现全球天气预报精度与效率平衡

近7日信号 1

论文DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

提出DASH方法,通过发散自适应监督范围提升推理模型的在线策略自蒸馏效果

近7日信号 1

论文Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

研究在效用约束下提升合成临床基准的真实性,解决医疗AI代理测试中因数据敏感导致的结构性失真问题

近7日信号 1

论文The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

对“图像思维”范式开展因果审计,发现视觉裁剪缩放等主动操作常带来边际或负向收益,质疑其实际效用

近7日信号 1

论文BaKron: Efficient Quantization with Kronecker-Factored Hessians

提出基于克罗内克分解海森矩阵的高效量化方法,加速GPTQ类自适应舍入算法

近7日信号 1

论文NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering

融合神经与符号方法的RAG架构,提升问答过程的可解释性,显式呈现中间推理步骤与知识溯源

近7日信号 1

论文On-Policy Self-Distillation without Any Supervision

提出无监督的在策略自蒸馏方法,摆脱对真实标签、环境反馈或人工指导的依赖,实现纯LLM内生优化

近7日信号 1

论文HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

提出首个聚焦LLM“运行时外壳”(harness)优化能力的评测基准,涵盖提示、工具、控制流等系统级组件

近7日信号 1

论文Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations

主张用可解释的代理式操作替代黑盒Top-K检索,在财报、审计报告等结构化长文档场景中提升RAG透明度与可控性

近7日信号 1

论文RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

提出基于排序的奖励构造方法,释放生成式奖励模型在LLM强化学习中的潜力,突破判别式模型瓶颈

近7日信号 1

论文Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

构建面向中国国标文档(GB/T)的规则密集型审查评测基准,填补LLM在专业合规审查能力评估空白

近7日信号 1

论文Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

首次系统评估对话代理基准质量,指出其普遍存在任务不一致、场景简化、策略覆盖不足等问题

近7日信号 1

论文Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data

提出交互式神经符号框架,从关系型数据中自动构建分析语义模式,支持自然语言查询与报告生成

近7日信号 1