论文SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
提出 SearchOS-V1 框架,解决多步搜索中任务进度跟踪与失败恢复问题,提升信息检索型 Agent 协作鲁棒性
近7日信号 1 条
论文SceneBind: Binding What and Where Across Vision, Audio and Language
提出 SceneBind 多模态表征框架,首次实现跨视觉、音频、语言的联合语义与三维空间理解
近7日信号 1 条
论文RoboTTT: Context Scaling for Robot Policies
提出 RoboTTT 方法,将机器人策略的视觉运动上下文扩展至 8K 时间步,显著提升长时序具身控制能力
近7日信号 1 条
论文GPT-Red57
OpenAI提出的自动化红队系统,通过自博弈提升模型安全性、对齐性与抗提示注入能力
「GPT-Red不是产品,而是AI安全工业化的新标准制定者——它正在把‘红队’从成本中心变为模型迭代的必需燃料。」
近7日信号 3 条
论文AI Scientists — Tools, Co-authors, or Founders?
ICML 2026 Workshop核心议题,探讨AI在科学发现中从工具到创始人角色演进的认知框架
近7日信号 1 条
论文Ψ₀: Efficient Scaling of Real-World Robot Data
RSS 2026发表的具身智能基础模型论文,提出用方法优化替代数据量堆叠,仅需30小时真机数据即可训练有效模型
近7日信号 1 条
论文Measuring progress toward AGI: A cognitive framework50
Google DeepMind提出的AGI进展认知评估框架,并同步发起Kaggle评测竞赛
「这是AGI评估范式的学术锚点事件,不构成直接创业机会,但为AI测评基建、教育型评测工具及认知科学交叉产品提供底层方法论入口。」
近7日信号 1 条
论文Decoupled DiLoCo
Google DeepMind提出的新型分布式AI训练框架,提升韧性与可扩展性
近7日信号 1 条
论文GeneBench-Pro
OpenAI发布的面向基因组学与生命科学的全新AI基准,采用真实世界复杂数据集评测模型科研能力
近7日信号 1 条
论文SWE-Bench Pro评估问题分析
OpenAI指出主流编码基准SWE-Bench Pro存在可靠性缺陷,警示AI代码能力评估需更严谨方法论
近7日信号 1 条