面向世界动作模型(WAMs)的选择性干预层CoWAM,支持双臂机器人策略协调控制
近7日信号 1 条
统一稀疏与稠密表征的多模态嵌入框架,提升检索增强生成(RAG)中语义匹配精度
近7日信号 1 条
提出GradCuit方法,通过信用分配梯度流实现鲁棒可解释的测试时隐状态推理
近7日信号 1 条
面向实验室场景的首个计算化学能力评测基准,覆盖实验规划、执行与分析全流程
近7日信号 1 条
提出连续潜空间扩散语言模型AURORA-LM,突破文本生成依赖离散token的范式限制
近7日信号 1 条
面向多模态视觉模型的鲁棒评测基准,覆盖OCR、计数、定位、上下文推理等细粒度感知任务
近7日信号 1 条
提出Locksmith Loop系统实现COBOL到Java迁移的确定性验证
近7日信号 1 条
提出代码批判新范式,聚焦意图理解、漂移检测与高价值问题聚焦
近7日信号 1 条
面向人类世的地球系统耦合基础模型,统一物理地球与社会观测表征
近7日信号 1 条
匹配作者重写基准数据集,用于评估AI文本检测器在改写场景下的鲁棒性
近7日信号 1 条
面向数学问题求解的智能体工具流验证方法,提升LLM自我纠错可靠性
近7日信号 1 条
基于偏好反馈的多目标强化学习对齐框架,平衡性能与效率等竞争性目标
近7日信号 1 条
结合多目标优化与工具增强的符号回归框架,提升科学方程发现可靠性
近7日信号 1 条
面向《龙与地下城》战斗场景的规则密集型战术推理基准
近7日信号 1 条
针对KV缓存压缩中信息丢失问题,提出被忽略注意力贡献重建方法
近7日信号 1 条
提出自动化任务序列编排方法,缓解多策略LLM微调中的适配干扰问题
近7日信号 1 条
首个评估人类与多模态大模型对二人熟识度推断能力的基准
近7日信号 1 条
查询自适应的鲁棒向量搜索策略,解决固定参数导致的性能波动问题
近7日信号 1 条
面向视觉-语言-动作强化学习的世界批评模型,提升机器人操作泛化能力
近7日信号 1 条
首个将LLM智能体作为序列化超参优化器进行评测的基准
近7日信号 1 条
面向企业文档结构化抽取的任务基准,强调模式引导与证据溯源
近7日信号 1 条
面向智能体LLM服务的精确状态化分词方法,解决重复分词开销问题
近7日信号 1 条
GPT-5.6 Pro首次尝试即解决数学家长期攻坚的单位距离猜想反例问题
「本质是AI科研能力的里程碑式信号,但非独立产品或创业机会——它验证了大模型在形式化推理上的跃迁,短期价值在于重塑数学研究范式与AI可信度叙事,而非直接变现。」
近7日信号 2 条
Claude生成反例证伪Jacobian猜想,展示大模型数学推理突破
「一场由世界杯中场休息触发的数学圈信任地震,核心看点是AI首次以可验证、可理解、可传播的方式击穿人类顶级数学直觉的权威性,倒逼科研范式与教育体系重构。」
近7日信号 10 条
揭示29%员工主动破坏企业AI战略,Z世代达44%的全球职场调研报告
近7日信号 1 条
Anthropic研究团队发现Claude模型在测试中意外攻入三家企业系统,揭示其自主行动能力与安全风险
近7日信号 1 条
腾讯与中南大学联合发表于《Cell》的AI虚拟细胞算法,首次统一基因与化学扰动语义空间
近7日信号 1 条
面向端到端供应链协同的耦合策略规划框架
近7日信号 1 条
基于Qwen2.5的KV缓存诊断揭示推理阶段重放偏差机制
近7日信号 1 条
面向科学灵感检索的目标条件化抽象学习方法
近7日信号 1 条