AI商业灯塔
论文SWE-Prime

提出更高效的软件工程微调范式,用更少轨迹数据实现更强代码问题解决性能

近7日信号 1

论文WikiSkill

将AI代理交互经验编译为持久化知识库,实现技能自主演化,推动Agent长期适应能力

近7日信号 1

论文CritICL

提出推理时弱到强泛化新方法,利用小语言模型失败模式提升大模型推理鲁棒性

近7日信号 1

论文大模型隐藏推理与可解释性研究

探究大模型内部未显式输出的中间推理过程及其可干预性

近7日信号 1

论文When Pruning Meets Interpretability: Preserving Sparse Autoencoder Robustness in LLMs

系统研究剪枝对稀疏自编码器(SAE)鲁棒性的影响,提出保持LLM内部表征可解释性的压缩方案

近7日信号 1

论文Unveiling Spectral Mechanisms in Training-Free LLM Text Detection

揭示训练无关LLM文本检测中的频谱机制,超越平均置信度指标,提供可解释的机器生成文本判别依据

近7日信号 1

论文LivingRAG: Augmenting Graph RAG with Experience

提出LivingRAG框架,将LLM响应中的推理经验持续注入知识图谱RAG,实现跨查询记忆复用与长期知识沉淀

近7日信号 1

论文SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

发布SciMIF基准,首次系统评测多模态大模型在科学领域的指令遵循能力,覆盖论文图表理解与实验推理

近7日信号 1

论文Multi-Granularity Context-Enhanced RAG over Multimodal Knowledge Graphs

提出基于多粒度上下文增强的多模态知识图谱RAG方法,提升多跳问答中结构化知识利用效率

近7日信号 1

论文AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

提出AsymSpec推测解码方法,针对具身智能体长上下文场景设计非对称缓存策略,在降低延迟同时保持任务精度

近7日信号 1

论文VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

提出VoiceMem流式双脑记忆架构,分离信息性左脑与情感性右脑,提升对话系统实时交互的记忆准确性与共情能力

近7日信号 1

论文A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks

提出基于自演化多智能体的LLM越狱攻击防御框架,动态对抗角色扮演、混淆、代码变形等新型越狱策略

近7日信号 1

论文VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

提出VISA框架,通过多智能体自演化机制生成可验证、具挑战性的多模态指令数据,突破单次生成-过滤范式

近7日信号 1

论文Trace Integrity for LLM Data Agents

面向LLM数据代理的轨迹完整性准则,解决结构化数据任务中正确答案与错误推理路径并存问题

近7日信号 1

论文How Much Rank Does LoRA Need? Rank-Error Bounds for Transformer Attention

为Transformer注意力机制LoRA适配提供理论化的秩-误差边界分析

近7日信号 1

论文ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows

面向多智能体LLM工作流的质量-成本权衡在线进度引导编排框架

近7日信号 1

论文Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa

首个针对南美原住民语言Baniwa的Whisper语音识别微调研究

近7日信号 1

论文Prefix Sliding for efficient test-time scaling

前缀滑动机制提升大模型测试时扩展效率,缓解长思考任务内存瓶颈

近7日信号 1

论文Gating Before Commitment: Anticipating Intent Divergence in Autonomous Driving

自动驾驶中意图分歧预判门控机制,防止交互决策失败

近7日信号 1

论文$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

通过强化学习训练机器人用自然语言进行推理,提升操作任务分解与约束跟踪能力

近7日信号 1

论文SwarmWorld: Stigmergic technological evolution in societies of language-model agents

语言模型智能体社会的群集信息素式技术演化框架

近7日信号 1

论文ICON Decomposition: Multivariate Concept-Level Explanations of Deep Representations

面向深度表征的多变量概念级可解释性方法,用于模型审计与捷径学习检测

近7日信号 1

论文TraceML: An Empirical Analysis of Human-Agent Planning in ML Development

首次实证分析人类与AI代理在机器学习开发中的协同规划行为

近7日信号 1

论文Planetary Prediction Engine: Autonomous Geospatial Prediction

基于智能数据选择与基础模型嵌入的自主地理空间预测引擎,应对全球性挑战

近7日信号 1

论文Finding and using interpretable latents in a neutrino foundation model with sparse autoencoders

首次将稀疏自编码器机制可解释性应用于粒子物理中微子基础模型

近7日信号 1

论文PlanSightRAG: A Visual-First Multimodal RAG for Civil Standard Plans

面向土木工程标准图纸的视觉优先多模态RAG系统,保留几何布局信息用于合规性检查

近7日信号 1

论文Agentic Autoresearch for Cell-Edge Power Control

面向蜂窝网络边缘功率控制的自主研究智能体,实现ML算法设计层自动化

近7日信号 1

论文MyoMechanix: Biomechanically-Grounded Compositional Skilled Activity Understanding and Coaching

融合生物力学建模的动作理解与教练系统,突破纯视觉动作质量评估局限

近7日信号 1

论文A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training

面向多模态大模型的无监督持续后训练框架,解决流式未标注数据下的视觉依赖建模问题

近7日信号 1

论文VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

面向原生视觉推理的可扩展可验证评测套件,将图像/视频作为第一类推理媒介

近7日信号 1