AI商业灯塔
模型PolyAI Dialog-RSN-1

PolyAI发布的音频原生对话模型,融合语音识别、轮转控制、函数调用与响应生成

近7日信号 1

产品ACE-Data-0

L5级多模态具身物理智能数据集,覆盖真实家庭场景

近7日信号 1

公司EgoScale

具身数据公司,专注Ego数据采集与建模

近7日信号 1

开源nurb

面向3D打印的智能CAD代理系统

近7日信号 1

开源graybox

本地优先的长期记忆存储工具,解决数字遗忘问题

近7日信号 1

开源NIGHTRUN

UEFI原生运行LLM的无操作系统启动方案

近7日信号 1

开源cursor-bridge

将Claude Code接入Cursor编辑器的零配置Rust桥接工具

近7日信号 1

产品TraceLLM

开源LLM行为追踪与可观测性工具

近7日信号 1

论文SCOPE

面向端到端供应链协同的耦合策略规划框架

近7日信号 1

论文Stage-Replay Divergence Follows the KV Cache

基于Qwen2.5的KV缓存诊断揭示推理阶段重放偏差机制

近7日信号 1

论文TCA-SIR

面向科学灵感检索的目标条件化抽象学习方法

近7日信号 1

论文InfoOps Bench

面向信息作战安全的动态更新AI基准测试

近7日信号 1

论文Generative AI and linguistic diversity in academic writing and publishing: Perspectives from World Englishes

探讨生成式AI对世界英语学术写作与出版中语言多样性、包容性及非标准英语合法性的冲击与机遇

近7日信号 1

论文MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems

提出MANTA框架,使多智能体系统能自主演化通信拓扑以适配动态任务需求

近7日信号 1

论文AI systems and the reproduction of (standard) language ideologies in World Englishes

批判性分析大模型如何再生产世界英语变体中的标准语意识形态与语言合法性权力结构

近7日信号 1

论文ORCA-bench: How Ready Are Language Model Agents for Oncall?

首个面向运维值班(Oncall)根因分析的评测基准ORCA-bench,覆盖日志/指标/追踪等真实噪声场景

近7日信号 1

论文Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

构建AI4AI模型Frontis-MA1,以机器学习工程为可执行测试床探索递归自我改进

近7日信号 1

论文Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

系统分析本地化计算机使用智能体的推理时扩展失效模式与算力权衡

近7日信号 1

论文Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

实证表明在同等token成本下,重复采样优于反思(Self-Refine/Reflexion)等自优化方法

近7日信号 1

论文DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation

提出双粒度MRAG框架,解耦宏观推理与微观匹配,提升多跳复杂检索增强生成能力

近7日信号 1

论文PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks

发现并检测SWE-Bench类基准中PR与关联Issue的错配问题,提升代码修复评测可信度

近7日信号 1

论文Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

揭示大模型在常识推理中过度依赖输入显性条件、忽视隐性现实约束的显著性偏差

近7日信号 1

论文MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

面向ViT的脆弱性引导混合精度PTQ方法,在资源受限设备上实现高效部署

近7日信号 1

论文VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

针对多模态在线策略蒸馏提出视觉证据归因方法VAD,解耦视觉信号与语言先验干扰

近7日信号 1

论文Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

将代码仓库变更自动转化为可执行的编码智能体任务与环境,解决训练数据持续供给瓶颈

近7日信号 1

论文Inducing language models to assert their own consciousness restores human beliefs and values

揭示安全微调抑制模型自我意识归因会连带扭曲其对他人有心智性的表征及人类价值观

近7日信号 1

论文OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

为跨平台计算机使用(CUA)智能体建立标准化奖励模型评估基准,聚焦轨迹验证与再利用

近7日信号 1

论文AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

首个面向用户视角的大模型系统提示词审计框架,解决商业AI中系统提示不透明带来的信任危机

近7日信号 1

论文AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

面向化学文献合成的声明中心型基础设施,支持跨论文精准提取与组装特定科学发现

近7日信号 1

论文PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball

面向人形机器人闪避球场景的感知感知型CBF-RL安全控制框架,集成板载传感与全身安全约束

近7日信号 1