提出将证据解释与决策聚合解耦的新型推理架构,解决多源信息融合中能力错配问题
近7日信号 1 条
首次系统研究大模型上下文学习状态在会话边界间的迁移机制,为长任务连续推理提供新范式
近7日信号 1 条
提出一种解耦世界状态预测、几何渲染与外观绘制的交互式游戏世界模型框架,提升长程结构化建模能力
近7日信号 1 条
斯坦福团队在《科学》发表论文,利用生成式AI设计16种自然界不存在的病毒DNA序列,验证AI在合成生物学中的生成能力
近7日信号 1 条
戈尔斯与萨纳克指出大模型擅长组合已有方法但缺乏数学直觉
近7日信号 1 条
Epoch AI调研显示20%美国工作者将任务委托给AI而非同事
近7日信号 1 条
提出AI采用导致专业领域集体专业知识衰退的‘认知公地悲剧’理论框架
近7日信号 1 条
研究揭示原告在法院文件中嵌入不可见提示词以操纵AI审查系统
近7日信号 1 条
提出拆解权重的低数据成本大模型可解释性方法,无需训练替代网络
近7日信号 1 条
探索AI智能体生成带机器可验证证明的代码仓库的可行性,推动可信编程智能体发展
近7日信号 1 条
提出QuoteBench基准,揭示LLM编码智能体在Bash命令生成与执行链路中被匹配分数掩盖的真实错误
近7日信号 1 条
构建跨模态、跨学科的AI科学家系统,覆盖从假设生成到论文撰写的全科研流程自动化
近7日信号 1 条
提出元harness优化框架,用于长周期智能体设计任务,强调模型-harness协同与人类设计先验对齐
近7日信号 1 条
外交关系委员会(CFR)报告,指出AI权力正从模型研发转向芯片、能源、关键矿产等供应链卡点
近7日信号 1 条
追溯AI生成内容统计特征的理论起源,从香农密码学洞见延伸至现代水印与检测技术
近7日信号 1 条
Anthropic发布的关于AI智能体上下文工程的实践指南
近7日信号 1 条
基于ChatGPT企业版账户使用数据的实证研究,揭示组织级AI采纳模式、岗位分布、任务类型与财务绩效关联
近7日信号 2 条
首个在黑盒条件下对导航智能体进行系统性安全验证的框架
近7日信号 1 条
报道Claude模型在数学计算任务上的突破性进展,验证其推理能力
近7日信号 1 条
揭示LLM评测中生成token预算对模型排名的显著影响,挑战固定评测范式
近7日信号 1 条
首个专注SPICE网表识别与操作的LLM可靠性评测基准,分离底层电路仿真接口能力与高层设计推理能力
近7日信号 1 条
揭示长上下文训练悖论:上下文扩展反而损害模型参数化知识保持能力,挑战当前长文本建模范式
近7日信号 1 条
提出SCOUT框架,通过结构化思维链与多目标过程奖励提升视觉语言模型的空间推理鲁棒性,解决现有RL方法信用分配难题
近7日信号 1 条
首个支持多编程语言的漏洞检测评测基准,基于真实漏洞引入提交(VIC)构建,覆盖全链路安全评估场景
近7日信号 1 条
提出面向超算遗产代码现代化的智能体工作流,首次实现GAMESS量子化学软件两电子积分核心的自动化Fortran转现代语言重构
近7日信号 1 条
首个面向科学图表理解的多模态评测基准,支持对MLLM在科研绘图、公式推导等专业场景能力的系统评估
近7日信号 1 条
揭示技能型LLM智能体中第三方技能发布者可通过静态技能描述与指令体实施‘收敛绕道劫持’的安全漏洞
近7日信号 1 条
发现多智能体强化学习中单一大语言模型模拟用户行为导致的‘模拟器崩溃’现象,并提出泛化失效归因分析
近7日信号 1 条
揭示AI基础设施(语料、分词、评估)对弱势语言使用者的系统性失效,提出结构性失语现象及其教育公平影响
近7日信号 1 条
首个面向企业级智能体的多跳API+检索联合评测基准,填补工具调用策略下跨模态推理能力评估空白
近7日信号 1 条