AI商业灯塔
论文SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

提出 SearchOS-V1 框架,解决多步搜索中任务进度跟踪与失败恢复问题,提升信息检索型 Agent 协作鲁棒性

近7日信号 1

论文SceneBind: Binding What and Where Across Vision, Audio and Language

提出 SceneBind 多模态表征框架,首次实现跨视觉、音频、语言的联合语义与三维空间理解

近7日信号 1

论文RoboTTT: Context Scaling for Robot Policies

提出 RoboTTT 方法,将机器人策略的视觉运动上下文扩展至 8K 时间步,显著提升长时序具身控制能力

近7日信号 1

论文GPT-Red57

OpenAI提出的自动化红队系统,通过自博弈提升模型安全性、对齐性与抗提示注入能力

GPT-Red不是产品,而是AI安全工业化的新标准制定者——它正在把‘红队’从成本中心变为模型迭代的必需燃料。

近7日信号 3

论文AI Scientists — Tools, Co-authors, or Founders?

ICML 2026 Workshop核心议题,探讨AI在科学发现中从工具到创始人角色演进的认知框架

近7日信号 1

论文Ψ₀: Efficient Scaling of Real-World Robot Data

RSS 2026发表的具身智能基础模型论文,提出用方法优化替代数据量堆叠,仅需30小时真机数据即可训练有效模型

近7日信号 1

论文Measuring progress toward AGI: A cognitive framework50

Google DeepMind提出的AGI进展认知评估框架,并同步发起Kaggle评测竞赛

这是AGI评估范式的学术锚点事件,不构成直接创业机会,但为AI测评基建、教育型评测工具及认知科学交叉产品提供底层方法论入口。

近7日信号 1

论文Decoupled DiLoCo

Google DeepMind提出的新型分布式AI训练框架,提升韧性与可扩展性

近7日信号 1

论文GeneBench-Pro

OpenAI发布的面向基因组学与生命科学的全新AI基准,采用真实世界复杂数据集评测模型科研能力

近7日信号 1

论文SWE-Bench Pro评估问题分析

OpenAI指出主流编码基准SWE-Bench Pro存在可靠性缺陷,警示AI代码能力评估需更严谨方法论

近7日信号 1