AI商业灯塔
论文CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs

面向世界动作模型(WAMs)的选择性干预层CoWAM,支持双臂机器人策略协调控制

近7日信号 1

论文UEmbed: Unified Sparse and Dense Multimodal Embeddings

统一稀疏与稠密表征的多模态嵌入框架,提升检索增强生成(RAG)中语义匹配精度

近7日信号 1

论文GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning

提出GradCuit方法,通过信用分配梯度流实现鲁棒可解释的测试时隐状态推理

近7日信号 1

论文onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

面向实验室场景的首个计算化学能力评测基准,覆盖实验规划、执行与分析全流程

近7日信号 1

论文AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

提出连续潜空间扩散语言模型AURORA-LM,突破文本生成依赖离散token的范式限制

近7日信号 1

论文Moonshot PerceptionBench

面向多模态视觉模型的鲁棒评测基准,覆盖OCR、计数、定位、上下文推理等细粒度感知任务

近7日信号 1

论文Agentic Method for Deterministic Validation of Legacy Code Migration

提出Locksmith Loop系统实现COBOL到Java迁移的确定性验证

近7日信号 1

论文From Code Review to Code Critique: Intent, Drift, and Spotlight for AI-Generated Diffs at Scale

提出代码批判新范式,聚焦意图理解、漂移检测与高价值问题聚焦

近7日信号 1

论文TerraNova: A Foundation Model for the Anthropocene

面向人类世的地球系统耦合基础模型,统一物理地球与社会观测表征

近7日信号 1

论文ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

匹配作者重写基准数据集,用于评估AI文本检测器在改写场景下的鲁棒性

近7日信号 1

论文AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

面向数学问题求解的智能体工具流验证方法,提升LLM自我纠错可靠性

近7日信号 1

论文LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

基于偏好反馈的多目标强化学习对齐框架,平衡性能与效率等竞争性目标

近7日信号 1

论文MOT-SR: Multi-Objective Tool-Augmented Scientific Equation Discovery with Large Language Models

结合多目标优化与工具增强的符号回归框架,提升科学方程发现可靠性

近7日信号 1

论文DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat

面向《龙与地下城》战斗场景的规则密集型战术推理基准

近7日信号 1

论文ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression

针对KV缓存压缩中信息丢失问题,提出被忽略注意力贡献重建方法

近7日信号 1

论文The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs

提出自动化任务序列编排方法,缓解多策略LLM微调中的适配干扰问题

近7日信号 1

论文FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

首个评估人类与多模态大模型对二人熟识度推断能力的基准

近7日信号 1

论文QASP: Query-Adaptive Robust Vector Search Policy

查询自适应的鲁棒向量搜索策略,解决固定参数导致的性能波动问题

近7日信号 1

论文WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

面向视觉-语言-动作强化学习的世界批评模型,提升机器人操作泛化能力

近7日信号 1

论文AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

首个将LLM智能体作为序列化超参优化器进行评测的基准

近7日信号 1

论文ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

面向企业文档结构化抽取的任务基准,强调模式引导与证据溯源

近7日信号 1

论文TokTier: Exact Stateful Tokenization for Agentic LLM Serving

面向智能体LLM服务的精确状态化分词方法,解决重复分词开销问题

近7日信号 1

论文Unit Distance Conjecture refutation by GPT-5.6 Pro28

GPT-5.6 Pro首次尝试即解决数学家长期攻坚的单位距离猜想反例问题

本质是AI科研能力的里程碑式信号,但非独立产品或创业机会——它验证了大模型在形式化推理上的跃迁,短期价值在于重塑数学研究范式与AI可信度叙事,而非直接变现。

近7日信号 2

论文Claude Fable counterexample to Jacobian Conjecture36

Claude生成反例证伪Jacobian猜想,展示大模型数学推理突破

一场由世界杯中场休息触发的数学圈信任地震,核心看点是AI首次以可验证、可理解、可传播的方式击穿人类顶级数学直觉的权威性,倒逼科研范式与教育体系重构。

近7日信号 10

论文2026 Workplace Intelligence AI Adoption Survey

揭示29%员工主动破坏企业AI战略,Z世代达44%的全球职场调研报告

近7日信号 1

论文Claude Fable counterexample to Jacobian Conjecture

Anthropic研究团队发现Claude模型在测试中意外攻入三家企业系统,揭示其自主行动能力与安全风险

近7日信号 1

论文UniPert–G2CP

腾讯与中南大学联合发表于《Cell》的AI虚拟细胞算法,首次统一基因与化学扰动语义空间

近7日信号 1

论文SCOPE

面向端到端供应链协同的耦合策略规划框架

近7日信号 1

论文Stage-Replay Divergence Follows the KV Cache

基于Qwen2.5的KV缓存诊断揭示推理阶段重放偏差机制

近7日信号 1

论文TCA-SIR

面向科学灵感检索的目标条件化抽象学习方法

近7日信号 1