AI商业灯塔
论文SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

发布SpeechSense数据集,首个聚焦副语言特征的细粒度语音情感分析基准,覆盖语调、节奏、停顿等维度

近7日信号 1

论文Collective Counterfactual Planning: Coordination, Consent, and Verification under Representational Constraints

提出集体反事实规划(CCP)形式化模型,刻画多智能体在表征约束下的协同规划、共识与验证机制

近7日信号 1

论文EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

提出自演化LLM智能体EvoTS-Agent,专用于金融时序变点检测,解决非平稳性与市场机制异质性挑战

近7日信号 1

论文Grading Needs a Rubric, Not Intelligence

提出any-to-bench框架,证明小模型按显式评分标准批改开放题答案可媲美大模型

近7日信号 1

论文Towards Zero-Shot Task Transfer with Neurosymbolic World Models

探索基于神经符号世界模型实现零样本任务迁移的新路径,弥合纯神经与符号方法在环境建模上的鸿沟

近7日信号 1

论文Recirculation

提出一种即插即用的推理时架构增强方法,显著降低现成基础模型的困惑度并提升生成与推理准确率,且几乎不增加延迟

近7日信号 1

论文Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging

提出带不确定性防护的LLM评判框架,在主观任务评测中提供可证明的风险控制保证,解决‘过度自信评判’问题

近7日信号 1

论文Policy-Invariant Reward Shaping from LLM Feedback

提出一种从大语言模型反馈中提取策略不变奖励塑形信号的理论框架,为混合式强化学习智能体提供可证明的稳定性保障

近7日信号 1

论文The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

发起面向语言学推理的开放挑战赛,聚焦模型发现隐含规则系统的能力,填补数学/代码之外的推理评测空白

近7日信号 1

论文Chain-of-Experience for Continual LLM Improvement

提出‘经验链’机制,使大语言模型能在推理时通过迭代交互持续提升自身能力,突破传统静态评测范式

近7日信号 1

论文Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

利用贝叶斯优化自动调优扩散模型采样过程,在保持质量前提下显著降低计算开销

近7日信号 1

论文StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents

提出面向知识工作智能体的版本化工作区框架,统一管理代码/文档等数字资产的解析视图、原生文件与变更历史

近7日信号 1

论文Delegation Asymmetry in Agentic Recommender Systems

首次实证研究代理型推荐系统中用户双向接受度(委托对话 vs 接收代理回复)的不对称性,为AI社交代理落地提供关键人因洞察

近7日信号 1

论文TokEval: A Tokenizer Evaluation Suite

首个系统性分维度评估LLM分词器性能的基准套件,聚焦其对模型能力的实际影响

近7日信号 1

论文On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

揭示基于记忆的自我改进智能体在任务顺序、方差和规格不足下的可靠性脆弱性,对具身智能与多智能体系统有重要警示

近7日信号 1

论文JAMA关于AI医疗决策不应强制医生介入的评论文章

《美国医学会杂志》发表评论,主张当AI在医学推理上超越医生时,监管不应强制保留人类最终决定权

近7日信号 1

论文AI递归自我改进可能不会快速到来

MIT科技评论分析指出LLM虽能写代码、生成数据,但完全自主的AI自我改进仍面临重大现实障碍

近7日信号 1

论文IJCAI-ECAI 2026计算机与思想奖

国际人工智能联合会议颁发的青年学者最高荣誉,吴佳俊因基础理论贡献获奖

近7日信号 1

论文SMOTE算法时间检验奖

经典机器学习过采样算法SMOTE获IJCAI-ECAI首届时间检验奖,表彰其长期学术影响力

近7日信号 1

论文AI systems quietly drop user instructions when they compress context

研究发现AI系统在压缩长上下文时平均丢弃83%用户指令,提出基于Qwen3.5-9B的轻量模块可保留超90%指令

近7日信号 1

论文LAVA: Logic-Aware Validation and Augmentation Framework for Financial Document Auditing

提出逻辑感知验证与增强框架LAVA,提升金融文档审计在异构输入下的准确性与可复现性

近7日信号 1

论文TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

构建TRACE-Bench基准,解构多参考图像生成任务,支持组合式评估而非预设任务类型

近7日信号 1

论文Topological Attribution Distance (TAD): Revealing Segment-Level RAG Influence on LLM Output Geometry

提出拓扑归因距离(TAD)度量RAG片段对LLM输出几何结构的影响,用于网络安全日志分析可解释性增强

近7日信号 1

论文GRIP: Grounded Reasoning via Information-Restricted Premises

提出GRIP框架缓解RAG中查询主导问题,通过信息受限前提强制检索证据参与推理

近7日信号 1

论文Steering the Flow: Inverting Face Recognition Models via Gradient-Guided Flow Matching

提出梯度引导流匹配方法实现人脸识别模型逆向攻击,提升重构精度与稳定性

近7日信号 1

论文Neurosymbolic Embodied Agents

提出神经符号具身智能体架构,融合符号推理保障执行可行性与神经网络感知灵活性

近7日信号 1

论文Historical Backtesting for Scientific Question Discovery

提出科学问题发现的历史回测协议,以可证伪方式替代主观专家评分评估AI科研提问能力

近7日信号 1

论文ClawGym II: Exploring Black-Box RL on Agent Harness

在Agent Harness平台上开展黑箱强化学习实验,拓展长周期任务中复杂环境交互训练能力

近7日信号 1

论文When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding

提出首个面向多AI编码智能体协作过程的量化测量框架,超越传统任务完成率评估

近7日信号 1

论文Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models

诊断大视觉语言模型在密集场景中同类别属性错绑问题,提出细粒度归因诊断方法

近7日信号 1