AI商业灯塔
论文OmegaUse-OfficeVal

面向长周期办公套件任务、具备经济性评估能力的LLM智能体基准

近7日信号 1

论文SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

提出SpecFirst范式,将行为规格获取作为从零构建Agent程序的第一步,弥合LLM在无代码库环境下的编程鸿沟

近7日信号 1

论文Improving Item Discoverability in e-Commerce Search via Related Intent Generation

通过生成关联用户意图提升电商搜索的商品发现能力,平衡精度与召回率

近7日信号 1

论文Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork

提出面向任务无关适配的伙伴能力估计算法,提升自主智能体在非固定协作场景中的泛化能力

近7日信号 1

论文DenseOn with the LateOn

提出完全开源的稠密+晚期交互检索模型训练方案,解决多语言与长上下文检索的可复现性问题

近7日信号 1

论文The Social Cost of an AI Teammate

揭示AI作为团队成员时如何实质性重塑人类小团队决策中的沟通模式与社会认知动态

近7日信号 1

论文APEX-Accounting

由Mercor与Ramp共建的前沿大模型会计能力评测基准,覆盖对账、费用计提、记账及报表生成等真实工作流

近7日信号 1

论文Can AI agents conduct open-ended AI research? Early evidence from two case studies

首次通过实证案例研究探讨AI代理能否开展真正开放式的AI科研,填补关键证据空白

近7日信号 1

论文Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models

提出仅通过输入提示优化即可抑制LLM中特定评估感知潜变量的方法,无需运行时模型访问

近7日信号 1

论文SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

基于SAM3D引导的物体中心表征对齐方法,增强VLA模型在遮挡与姿态变化下的3D细粒度理解能力

近7日信号 1

论文Toward Standardized Cross-Vendor Agent Tool Trust Management in Autonomous Networks

面向自治网络L4-L5级提出跨厂商AI工具信任管理标准框架,解决多厂商工具调用时的信任可见性缺失问题

近7日信号 1

论文Penelope: Localized Latent Recurrence for Efficient Structured Reasoning

提出局部化潜在循环机制以提升结构化推理效率,避免单纯扩大参数量或链式思维token化

近7日信号 1

论文Polistemics

首个理论驱动的政治信息中介评估基准,用于衡量LLM在选举与政治场景中负责任的信息传递能力

近7日信号 1

论文Does Runtime Topology Context Improve LLM-Generated Kubernetes Security Patches?

实证研究运行时拓扑上下文对LLM生成Kubernetes安全补丁质量的影响,探索云原生安全自动化新路径

近7日信号 1

论文Parallel Decoding Distillation for Fast Image and Video Generation

提出并行解码蒸馏方法,显著加速视频扩散/流模型生成,摆脱对变分分数蒸馏和对抗损失的依赖

近7日信号 1

论文Desktop-Delta Bench

首个专门评估计算机使用模型对桌面GUI状态迁移理解能力的基准,聚焦因果性与任务相关性重建

近7日信号 1

论文Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA

提出一种根据token不确定性动态调整专家数量的MoE LoRA路由机制,解决固定k值导致的资源浪费与覆盖不足问题

近7日信号 1

论文The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

针对多模态大模型视频定位任务提出的稀疏帧自适应方法

近7日信号 1

论文LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

首个聚焦体育领域真实世界预测能力的大模型评测基准

近7日信号 1

论文Evaluating Fuzz Testing for Reinforcement Learning Agents

首次系统评估模糊测试在强化学习智能体安全验证中的有效性

近7日信号 1

论文CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

面向长视频理解的置信度感知动态证据推理框架

近7日信号 1

论文D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

基于隐状态谱特征的LLM幻觉检测新指标D-Score

近7日信号 1

论文SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

基于经验增强的LLM智能体实现端到端极端天气预警的新型框架

近7日信号 1

论文构建AI原生创新体系

提出AI从科研辅助工具演变为AI科学家,需重构科研组织管理模式

近7日信号 1

论文SlopCodeBench

用于评估大模型代码能力的基准测试数据集

近7日信号 1

论文Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

批判性分析当前智能体评测协议有效性,指出任务设计与能力声称间的逻辑断裂风险,呼吁建立协议效度验证标准

近7日信号 1

论文IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

提出IDEAgent框架,首次实现科研创意生成中质量(Quality)与多样性(Diversity)的联合优化搜索,突破单目标局限

近7日信号 1

论文Agentic Root Cause Analysis through Evidence-Grounded Reasoning

面向工业异常诊断的证据驱动型智能体根因分析框架,支持假设生成与多源传感器证据自动采集验证

近7日信号 1

论文HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding

提出算法-硬件协同的HiKV缓存机制,通过分层重要性感知压缩KV缓存,缓解长上下文LLM推理内存瓶颈

近7日信号 1

论文SceneActBench: Can Agents Act on the 3D Scenes They See?

首个面向多物体完整3D场景交互动作能力评估的基准,聚焦VLM智能体在真实3D环境中的具身行动而非仅文本描述

近7日信号 1