arXiv论文
- 啄木鸟蒸馏:弱模型诊断强模型中的推理缺陷
- Otter:一款具备时间感知与历史上下文的人类国际象棋 AI
- 从连续预测变量到临床阈值:基于指南的分类法在缺血性卒中预后预测中的性能权衡研究
- 点火指数:衡量语言模型中的全局工作空间动力学
- OrchestraBench:评估多智能体编排的失效模式、恢复能力与任务拆解质量
- SCP-NL2TL:结合语义验证与选择性保形预测的自然语言转时序逻辑规范框架
- 具备自主决策能力的自动显微镜基准测试:支持系统资质认证,但未必能泛化至未见任务
- 抽象事件因果规则:归纳与应用
- PD-GS:基于音素驱动3DGS的音频驱动说话人脸生成
- 衡量与检测有害的AI谄媚行为
- 重精炼胜过重采样:大语言模型推理的测试时自我修正
- 异构注意力内存的运行时可观测性
- 当智能体AI遇见通感一体化
- 基于Volve油田的基础井况异常检测:构建标签、基线模型与双头模型
- StepReflect:面向移动端GUI智能体的结构化UI转换反思
- 活动帧:用于智能体记忆与回放的确定性屏幕活动编译
- AgentOPSD:面向智能体强化学习的递归自蒸馏方法
- ECG-LENS:融合导联感知与临床上下文的心电图报告生成与评估
- CogVis:开放词汇表变化检测是否需要为每个查询重新感知场景?
- 面向放牧生产系统的牛群生长模式与增重预测混合机器学习框架
- PaDoc:基于版面基础的文档解析并行解码框架
- GSBF:面向环境感知波束赋形的 3D 高斯溅射技术
- EnvACE:通过世界彩排将环境动力学内化用于智能体强化学习
- TS-RAG:用于时间序列预测的检索增强生成
- 低频陷阱:视频语言模型在简单事件记账上的失败
- 面向工业因果推理的模拟器基座大语言模型:污水处理决策支持中的工具调用、结构化注入与厂间可移植检索
- 大语言模型中思维链推理的平均场动力学
- 观点:是时候优化大语言模型的自洽性了
- 面向智能科学的层级服务器架构
- 面向模块化大模型安全代理的事后轨迹风险认证
- 评估大语言模型中的投资逻辑:迈向个性化金融智能体的真实世界基准
- 新兴的零售投资组合管理应用:基于自然语言目标的个性化、税收意识强化学习
- 图灵的第一个模仿游戏:设计理念与“人类趋近机器”的全新解读
- GAUGE:面向不完整多模态分类的粒度自适应反事实证据门控
- LC-GRPO:通过朗之万修正弥合基于流的 GRPO 训练与推理差距
- SafeDivertor:通过利用时频先验从宏观等离子体状态信号中高保真重建偏滤器热通量
- 当经验化为指令:自进化智能体技能系统中的轨迹投毒
- 用一张纸劫持机器人:VLM控制机器人中物理提示词注入的系统性研究
- UniVVT:用于高保真视频虚拟试穿的统一端到端框架
- CodeGrep:面向大模型编程智能体的强化学习检索代理
- ProDVI:用于价值网络初始化的程序化动力学先验
- 超越 Top-K:用可解释的智能体操作替代黑盒检索
- MACRO:Transformer 层的马尔可夫链路由
- MameLoshnLM:意第绪语语言模型与评估基准
- 自监督预训练对于提升医疗时间序列诊断真的有用吗?
- 超越序列顺序:Transformer 的句法感知位置编码
- 面向编码智能体的全局可重用技能学习
- 基于深度引导的拥挤场景视频目标计数
- 资源化权威:部署态AI智能体参与式治理的机制设计模型
- 基准测试的基准:评估对话智能体评测集
- 矩阵带状注意力机制:Set Transformer 的上下文自适应值投影
- AV-AIVAT:基于不完全信息博弈中认证随时有效停止机制,将智能体评估成本降低 74 倍
- BaKron:基于克罗内克因子化黑塞矩阵的高效量化
- 马尔可夫决策过程的属性驱动因果抽象
- 从样例中学习形状:递归 SHACL 中形状学习的基础
- 调用还是不调用:评估与优化大语言模型工具调用的框架
- AI玩商业游戏:在动态模拟中对大语言模型管理决策能力的基准测试
- 基于可微分D-vine Copula的局部化异常检测
- OSReward:建立跨平台电脑操作智能体奖励模型的标准化评估体系
- DASH:用于自动化贝叶斯优化的解耦自适应代理-采集框架
- 流匹配不确定性的几何学:零成本不确定性代理及其在基于流的VLA故障检测中的应用
- 截图还是工具?混合 GUI-MCP 计算机操作智能体中的工具调用与多模态上下文管理
- DeepForgeSeal:利用对抗性强化学习进行深度伪造检测的潜空间驱动半脆弱水印技术
- CUDA-L2:通过强化学习超越 cuBLAS 的矩阵乘法性能
- 短上下文语言建模中的逐层位置偏差
- 基于大语言模型的智能体化软件缺陷修复:综述
- PhaseCoder:面向多模态大语言模型的麦克风几何结构无关空间音频理解
- 大语言模型生成式推理中层剪枝的局限性探究
- FI-TW:用于芬兰铁路晚点分析的开放列车天气数据集
- 全象限有界裁剪 GRPO:消除无界盲区以实现稳定且泛化的训练
- MARS:用于奖励建模的边界与语义感知数据增强
- 随机鹦鹉还是和谐共鸣?测试五大主流大模型利用合成数据复刻人类调查的能力
- 当草稿模型在进化:投机解码与在线学习的完美结合
- 域门控潜在扩散:基于第一性原理验证的 HMX 级含能材料生成式逆向设计
- λSplit:用于荧光显微成像的自监督内容感知光谱解混模型
- 在线推理校准:测试时训练赋能可泛化的共形大模型推理
- InferQ:面向量子电路模拟的数据库基准测试
- WitCert:KV缓存量化的可靠运行时风险可观测性与控制门控
- 四足机器人运动的快速具身自适应
- Dream-MPC:基于潜在想象的梯度模型预测控制
- PICopilot:基于大语言模型的智能体框架,助力光子集成电路脚本化设计
- EviGraph:证据引导的自主科研智能体
- 深入剖析 EvoMap:自进化智能体间协作网络的特性研究
- InsightEmb:学习用于智能体洞察检索的动作-意图嵌入
- RepoProbe:使用检查表评估架构感知的代码库理解能力
- NVIDIA Cosmos-H-Dreams:将实时生成式模拟引入手术机器人
- 如你所愿:在精准农业中结合大语言模型与形式化验证的任务规划
- 将 Nunchaku 4-bit 扩散推理引入 Diffusers
- A-SR:基于分层协同的自进化智能体大模型符号回归
- LeRobot v0.6.0:想象、评估、改进
- 超越LoRA:你能打败最流行的微调技术吗?
- 我们是如何让本地开源模型免费为 OpenClaw 仓库进行 Issue 和 PR 分流的!
- 将 hf CLI 设计为面向智能体的 Hub 交互优化工具
- PyTorch 性能分析(第二部分):从 nn.Linear 到融合 MLP
- OlmoEarth v1.1:一个更高效的地球观测模型家族
- AWS 上的基础模型训练与推理构建模块
- Granite Embedding Multilingual R2:开源 Apache 2.0 多语言嵌入模型,支持 32K 上下文——百兆参数以下最佳检索质量
- 学习预测 MLLM 中的中间层注意力以实现视觉 Token 剪枝
- 利用深度强化学习解决车辆路径问题:工业卡车规划案例研究
- 让知识蒸馏成本大幅降低以实现规模化运行
- 面向聚合物自动化粗粒化分子动力学的多智能体框架
- 构建低延迟多语言语音智能体:NVIDIA Magpie TTS 带来开源权重与全面部署控制
- Capek 0.5:面向具身智能的以执行为中心的视觉语言模型
- bioMoR:用于高效基因组学习的生物学引导递归混合模型
- WebRider:面向实时网页辅助的个性化意图控制器
- Gated-BEPO:面向大语言模型智能体的置信门控贝尔曼信用分配
- Fast LapSum:百万级规模下的精确可微 Top-k 算子
- 填补鸿沟:用于统一多任务用户意图推理的双知识图谱框架
- 成交还是拒绝:情绪在多智能体谈判中的作用
- 大语言多模态模型模态转换:自主地理信息系统(GIS)代理的先决条件
- 将分诊决策拆分给多个智能体:是隐藏了偏见还是有助于发现偏见?基于LLM资源分配在审计容量限制下的多智能体模拟研究
- 通过分块 SVD 寻找可用的权重机制
- 并非所有问题都适合建模为 MILP:一种面向 DSL 的灵活且精确的优化建模框架
- 忽视关键投票:聚合独立性指标未能揭示验证真正起作用的地方
- PTQ4SNN:面向脉冲神经网络的膜电位感知后训练量化技术
- Transformer 难以利用其涌现的世界模型:重探河内塔与思考的错觉
- 偏微分方程基础模型的无监督自适应
- DiDPO:面向编程智能体训练的差分双重策略优化
- DocMemo:基于概率记忆引导检索的多模态文档理解动态证据发现
- 智能体记忆蒸馏:利用分层教师记忆赋能小型大语言模型智能体
- 塑造你的信息流:基于大语言模型的对话式推荐智能体系统
- CoBa:通过计算均衡路由实现高性价比的测试时扩展
- 窥视取胜:预算执行不到位与测试集选择抬高了短预算 AutoML 的对比表现
- 一图胜千Token:视觉语言模型如何在大幅降低AI能耗的同时提升准确率
- Muon 训练 Transformer 中的表征-读出接口后突悟崩塌现象
- QFCQT:用于高波动性时间序列预测的混沌门控量化变压器框架
- 交互催生独立状态下所不具备的动态AI行为
- Fisher-R1:训练用于可靠假设检验的大模型智能体
- TEPA:为抗冲突语言智能体撤销陈旧记忆
- TransSLR:用于手语识别的轻量级 Transformer
- 通过对跖分离技术对无偏置 GLU 前馈模块进行密码分析提取
- AI角色会成长吗?重大生活事件后LLM智能体个性演变的分析与基准测试
- NiyamAI:一个基于零知识证明构建、具备密码学可验证护栏的意图绑定型AI智能体
- 通过随机数生成缓解大模型作为裁判时的评分偏差
- 超越“AI语言”:大模型输出具有类个体语言特征(Idiolect)的研究
- 编程智能体的在线监控与纠偏导向
- KReF:用于长期时间序列预测与预测不确定性的免训练检索框架
- SoRoMoX:快速、可微分且可并行化的软体机器人模型
- ReLU 网络中隐藏规范对特征专业化的控制
- 通过 Nyström 方法弥合超维计算与核方法的鸿沟
- SLED:通过知识蒸馏实现可扩展的位置编码
- 基于错时更新实现终身多智能体路径规划的可扩展长远视界规划
- 注意力头的自主性:利用冻结的查询-键几何实现免数据的稀疏注意力机制
- Ask-E:用于校准问题生成的环境
- 基于多智能体取证推理的通用深度伪造视频检测
- 绕过 Krum:联邦学习中的感知选择性后门攻击
- AutoIntervene:面向动作分块模仿学习策略的校准式干预方法
- 基于智能体混合自顶向下与自底向上方法的知识图谱生成
- RoRA:面向多模态大语言模型视觉token剪枝的面向角色区域分配方法
- PHASE-Tree:长程角色扮演对话中的角色状态演化建模
- 通过零知识证明实现图像溯源的软修订
- 基于决策树剪枝的可解释强化学习
- 加速器调试算法的自主发现
- EliSeg:基于报告定位的异常分割与验证目标构建
- 迈向用于决策与智能体 AI 的因果数据管理生态系统
- 基于OpenArm的实验室移动操作之表征交接
- 大语言模型的地理空间概念探测:抽象性、组合性与基础性
- 零差距不等同于恢复:基准测试污染的分层逐题概率评估与逐步缓解策略
- FUSE:面向混合类型表格流匹配的跨列交换特征级统一专业化方法
- LSEAD:一种基于大语言模型的隐私保护语音分析框架,用于阿尔茨海默病早期筛查
- PACE:用于自动化算法设计的原语感知代码演进
- 我在视频中寻找你:面向以人为中心视频推理的身份条件化查询
- 作为攻击目标与对抗者的扩散大语言模型:机理性安全漏洞
- HarnessSafe:评估智能体外壳中持久化载体的安全性
- 复杂天然产物的策略优先合成规划
- 反事实模拟训练:提升思维链的忠实度
- 严肃游戏:人机交互、演化与协同演化
- AutoMOOSE:用于自主相场模拟的智能体AI
- INTRYGUE:基于归纳感知的熵门控机制实现可靠的RAG不确定性估计
- 使用深度学习图像分割和几何建模从零回波时间 MRI 中自动提取的测量结果与专家手工读数高度一致
- Ratchet:LLM裁判需要多高的可靠性才能淘汰一项技能?
- AI智能体能否进行开放式AI研究?两项案例研究的初步证据
- 可信智能体网络:智能体网络中的信任必须是原生构建的,而非事后补救
- 权重空间消融下的跨层交互:闭式注意力雅可比边界与真实预训练模型测试
- OpenForgeRL:在任意环境中训练 Harness 原生智能体
- 面向长周期终端任务的递归合成
- 观测数据因果推断的最优传输理论入门
- 面向搜索智能体的上下文信息策略优化 (CIPO)
- Fluid-DiT:用于流体流动模拟学习的无图扩散Transformer
- 追求 SOTA:时间序列预测必须采用分类特定的评估方法以消除虚假增益
- LoCA:基于局部信用分配与单次校准的大模型前向微调方法
- CASA:基于安全注意力增强分类的鲁棒多模态对齐
- SignVerse-2M:一个包含 55 种以上手语、拥有两百万剪辑的姿态原生宇宙
- 探究自动驾驶轻量级视觉语言模型中的视觉概念探测
- 从专家演示中进行奖励分配的最小化要素
- 以少胜多:一种用于四足机器人运动的 Dyna 风格强化学习方法
- GRM:通过梯度比率掩码对音频大模型实施兼顾效用的越狱攻击
- 迈向双塔推荐模型的理论理解
- LoCA:视觉基础模型的空间感知低秩卷积自适应
- 强化学习中状态抽象的组合行为语义
- 抛弃锚点:通过 Pulsar Attention 实现分布式系统的统计上下文摘要
- WAM-Diff2:用于高效率自动驾驶VLA的分层自回归到扩散蒸馏
- 通过多通道光谱精细化与Savitzky-Golay平滑优化基于MXene超表面的光谱预测
- Fortran 通用转译器:概念验证
- 反事实沙apley信用分配
- openPangu模型在昇腾NPU上的量化实证研究
- 跨资源区间的依存句法分析:评估高资源与低资源语言上的架构性能
- IFCLoRA:面向参数高效微调的拓扑感知秩分配方法
- 基于Whisper的波斯语语音情绪识别中ASR自适应与表征降维研究
- 面向大规模 GPU 推理的 KV Cache 预测性多层内存管理
- 基于技能的智能体AI系统中的动态联盟形成与通信定价
- MetaSpace:面向具身智能体空间认知的变形测试框架
- 考虑使用 ACE?我们能用更少的 Token 实现它
- AndroidReality:移动智能体距离现实世界还有多远?
- 孟德尔哥德尔机:通过比较进化实现递归自我改进的编码智能体
- 场即知晓:从导航到黑洞的跨维度几何学
- 谁来验证基准测试?去中心化大语言模型评估中的信任重构
- 跨位置与服务类别的受保护容量预算自适应两级分配
- 不会“跑偏”的AI科学家:四足机器人导航研究循环中的学术品味、结构化设计与可证伪发现
- TelemetrySuffBench:智能体遥测数据是否足以进行故障根源诊断?
- 多用户冲突中的权威期望效应
- REIN:通过反思与弃权对齐弥合推理与可靠性之间的鸿沟
- 上游决策,滞后写入:定位与评估多语言 MoE 的跨语言拒绝电路
- 用于医疗数据协调的双重混合语义数据湖架构:结合人机协同验证与大模型驱动的元数据标注系统
- 深思熟虑,一语中的:ReLIT,一种递归潜在隐式 Transformer 框架
- 大型语言模型中的量化退化:信号与噪声的视角
- 谁构建了这个模型?通过权重空间的谱指纹追踪大语言模型血缘
- 长 SKILL 合规性作为逻辑推理:基于闭包扎根检测与缩放引导的策略内蒸馏
- 探索大语言模型在真实海事导航场景中的态势感知与COLREG合规能力
- 你的提示词并非唯一的提示词:大模型对结构化输出模式描述的权重究竟有多高?
- LLMVisor:面向多租户大模型推理的实时延迟归因模型
- MCP 中的大语言模型至关重要:衡量由大语言模型驱动的低效资源利用
- 是什么阻碍了智能体技能的复用?来自 138K 个 SKILL.md 文件的实证研究
- 表面公平?大语言模型推荐系统中隐藏输出公平性差距的基准测试
- 被遗忘的历史还是经受住时间考验?从信息检索视角看 RAG 的回顾与展望
- FailForge:从持续失败中为代码智能体提炼程序性能力
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- Aero Realtime:实现低延迟流式多模态生成的完全对齐输入输出流
- 复现与压力测试大模型推理可靠性的两种方法:推理期概率聚合与逻辑表征编辑
- 广度推理而非深度推理:将推理溢价摊销为蒸馏技能
- 无法追责的授权、日渐衰退的技能:绘制职场AI代理的风险图谱
- 开源权重模型在金融文本理解领域能否与闭源模型一较高下?
- 智能压实:通过湖仓表元数据预测压实效用
- 一种受QUBO启发的机场陆侧瓶颈诊断与动态调度优化计算框架
- 基于本地视听动态的全能大模型延迟音频修剪技术 (A-PACK)
- 理论指导下的欺骗检测:基于 RAG 的人工智能探索
- 穿梭于讨论之间:用于现场小组讨论分析的移动可视化分析系统
- 结构动力学图世界模型:统一建模、约束展开与可解释校准
- 脚手架的重要性胜过接口:对七种智能体脚手架、五种语言模型以及一项软件任务中 MCP 与 CLI 工具调用的对照比较
- 提升多模态 RLVR 的泛化鲁棒性
- 阅读不等于推理:弥合视觉-文本压缩中的智能体策略鸿沟
- 面向主观任务的大语言模型推理:失效模式、缓解方案与动态推理路由
- 从手册到维护:微调 MedGemma 以支持低资源环境下的多模态影像系统
- PolicyKG:将机构政策转化为 SHACL 知识图谱的智能体 LLM 流水线
- 并非真正的无障碍:Android辅助功能如何将移动端AI智能体暴露于间接提示词注入风险中
- 不同的反馈,不同的更新:大语言模型基于用户交互的选择性自学习
- 商业真相而非 SQL 准确性:基于规则门控的 7B 分析智能体表现优于直接提示的 32B 基线模型
- 一阶证明搜索中保持结构的的不确定性传播
- 上下文不等于权限:金融市场智能体的结构化运行时治理
- CADEngBench:看起来像CAD,但它真的能用吗?评估参数化设计、装配推理与物理仿真
- 大模型引导的仿真轨迹启发式设计:动态生产与AGV调度案例研究
- P^3:用于验证代码生成的联合程序与证明规划
- 能力不等于倾向:测量公民大模型智能体中抗压协作行为
- KVDiagnosis:长文本大语言模型中 KV-Cache 压缩的诊断基准
- 主动推断生成模型的重整化:基础、推导与验证
- CoRCi:跨域序列推荐中相干兴趣的交叉重构建模
- 重新思考自进化智能体:我们是否仍然需要既定的优化流程?
- 线性化二维单纯形注意力机制
- 每个模型一个适配器对:语言模型的通用激活接口
- 从单向扫描到边界缝合:交错式跨块后训练量化
- 不匹配至关重要:超越Token一致性的在线蒸馏技术
- 模型发现智能体:利用大模型辅助的贝叶斯实验设计实现数据高效的机理世界模型发现
- 智能体自主研究即模糊测试 (arXiv:2608.09855 [cs.AI])
- SkillReason:针对隐式用户请求的推理增强型智能体技能检索
- 听觉、视觉与追踪:全模态语言模型的时空视听声学事件推理
- DSLE:黑暗之魂首领战学习环境
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- 基于《成人类卡牌游戏》(Cards Against Humanity) 的跨模型幽默偏好建模
- 心脏介入手术中增强型实时六自由度扩展现实导管追踪技术
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量化无人机导航潜能
- 开放世界分层感知:基于类别无关提议的分类抽象,实现对词表外道路物体的安全处理
- 多模态大语言模型不断演进的安全格局:新兴威胁与防御综述
- 针对深度 OCR 系统的对抗性攻击
- CosmosAlign:适配世界基础模型以实现生成式交通视频预测
- LGNNIC:利用智能网卡(SmartNIC)加速大规模图神经网络(GNN)训练
- 基于多任务一致性的对抗攻击检测
- SkillConsist:通过双向图对齐检测智能体技能中的不一致性
- 基于CFD引导的多模态生理信号概念漂移检测
- 基于SSMD的高通量筛选测定机器学习性能指标与苗头化合物选择
- ScaleSense:阿里巴巴 AnalyticDB 中基于学习型资源评估的成本智能扩展框架
- 轻量级微调下的路由器敏感性识别混合专家模型中的可剪枝专家
- 仅凭数值重构元数据:恢复无文档数据仓库中的列语义
- 谱奇异值揭示了Transformer注意力机制中占主导地位的学习结构
- EasyBalance:分布式 MoE 推理中的跨层负载均衡
- 提示词注入的解构:一种用于结构化分析的组件模型
- 抵御知识投毒与提示词注入的检索增强型入侵检测防御机制
- 大语言模型智能体系统中潜在妥协的组合威胁分析:66号令场景
- PRISM:通过地形诊断进行排列优化的预测性协议
- 将CT基础模型蒸馏为可编辑概念瓶颈以预测肺结节恶性肿瘤
- 两个有限前沿切片上的扎兰基维奇精确值
- 所有大语言模型都能感知自身是否在输出有害内容吗?针对模型家族潜在空间安全探测器的可复现性研究
- REVEAL:用于长视频问答中显式证据充分性验证的评分标准引导智能体
- 基于敏感度建模的开放世界语义分割
- 虚拟细胞的人机协同因果知识注入
- 推理型大语言模型中的隐藏语言一致性现象
- 缓解英语到罗马尼亚语机器翻译中的性别偏见
- 我们能否优化性能与碳排放的盈亏平衡点?探索更绿色的大语言模型
- 基于RAG的工业现场总线设备自动配置
- AI 预测集合是否采样了正确的条件分布?
- 从恢复到断崖:动作后训练如何削弱视觉语言模型(VLM)的深层深度可解码性
- GALA:微服务根因分析与事件响应的图增强大模型智能体
- 面向细粒度广义类别发现的傅里叶自监督方法
- 当置信度失效:大语言模型在不确定性与临床信息缺失情况下的过度自信
- SignLlama:通过优先处理视觉特征增强无词汇表手语翻译
- 两步式 MV-DeepONet:由随机输入场驱动的不确定性传播概率算子学习
- AI 辅助验证中的认知迁移:框架与评估协议
- 当隐空间遗忘像素:恢复扩散Transformer超分辨率中的保真度
- AkasicDB:基于统一向量-图-关系型 DBMS 演示全能检索增强生成(Omni RAG)
- SiriusDeliver:腾讯数仓交付自动化技术实践
- MusicLayout:用于可控文本生成音乐的显式结构规划
- 管理KV缓存:防止多租户大模型推理中的定时侧信道泄漏
- RL原生蒸馏:利用评分轨迹实现少步图像生成
- 通过大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法
- 小米 MiLM Plus 发布 PROVE:面向感知对齐的对象移除评估指标
- 大语言模型在工艺流程图工程中的应用:从最优PFD到验证级P&ID
- 多LLM智能体系统的动态治理与协作对话成果
- 基于边的连续型 p-中值问题及其在物流区划中的应用
- Conway 99-图问题的强制结构归约与可验证界限
- 迈向在线教育的可持续学习:一种强化学习方法
- 面向长时序PDE预测的几何感知增量神经算子
- CORA-Diff:面向高效扩散语言模型推理的置信度导向残差接受机制
- InfraBench:跨层级、全生命周期与风险评估的基础设施智能体基准测试
- 基于逆向心智理论的内容推荐建模:从网页浏览到动态智能界面
- 当自一致性适得其反:多数表决损害小型大语言模型在多数硬科学问题上的表现
- 部署决策可靠性:用于规划长周期智能体评估的泛化理论框架
- 从数字到判断:面向欧洲上市房地产的专业大语言模型智能体与强化学习
- 前沿大语言模型能否匹敌原生多模态嵌入?硬负例文本到图像检索的对比研究
- 迈向基于查询覆盖率与声明可验证性的查询无关型 RAG 评估
- 定位安全对齐:大语言模型中MLP层与网络中部模块编码拒绝行为
- CLAIM:基于不确定性度量的大语言模型开放域主动澄清框架
- EnterpriseRAG:基准测试大模型在非理想企业检索条件下的指令遵循与鲁棒性
- RecSys Factory:将大模型智能体自主性限制在工业推荐系统生命周期的决策点上
- CoAdapt-GUI:针对未见GUI应用的联合工作流上下文与策略自适应
- OEIS Open:语言模型能把多少猜想变成定理?
- 移动智能体评估中大模型裁判的基准测试
- 智能体技能也可能带来负面影响:大模型智能体中技能引发故障的实证研究
- 沉睡的智能体:基于要点的上下文压缩丢失了什么及其原因
- GUIDE:企业级文档到工件生成的受控统一智能框架
- 图结构评分标准:将评分标准编译为用于大模型裁判的类型化评估图
- 迷失在压缩中:评估上下文压缩下的侧面约束丢失
- 面向遗留HPC现代化的智能体工作流:GAMESS双电子积分核心的转换
- HyperANFIS:通过双曲几何增强自适应神经模糊系统中的规则表示与可解释性
- Mechanist:将人工智能作为探索智能机制的科学仪器
- 通过贝叶斯更新实现概率分布上的比例类比
- 面向多分类皮肤病变分类的不确定性感知的可解释集成深度学习框架
- 智能体安全性应当是一项运行时契约
- 评估网络安全中大语言模型生成的检测规则
- 自进化网络验证器
- 单周期智能体自归纳下AI护栏的生存状况
- 通过神经符号安全卫士引导端到端自动驾驶
- 强化完全正当代表性:高效验证与计算
- 大语言模型智能体中的后门净化动态学
- 影响力策略重要吗?大语言模型代码生成中提示词框架效应的研究
- 让它煮吧:在序列决策中学习等待
- SegPAR:面向语义分割的以类别为中心的基于决策的稀疏攻击
- 强化大语言模型中步骤级推理以实现高效自我纠错
- 智能体网络安全的下一个挑战:一个现实且无污染的逆向工程基准
- GCPO:诊断与约束大模型 Rollout 强化学习中的子空间几何
- 从多模态伪标签中学习:实现鲁棒的开放词汇实例与全景分割
- 评分标准随机丢弃(Rubric Dropout):缓解以评分标准为奖励的强化学习中奖励攻击的简单方法
- APEX:面向内存高效的边缘端 MoE 推理的自适应专家预取技术
- 超越单轮置信度:LLM 智能体的轨迹自适应不确定性量化
- 定位与控制大型语言模型中的隐式个性化
- 语义 Lenia:大语言模型语义空间中稳态孤子的涌现
- 措辞效应:量化大语言模型基准测试中的双向漂移
- LookBack:通过视觉参考使用情况评估大视觉语言模型响应的位置与方法
- 学会说服暴露了大模型轻易放弃正确信念的弱点
- MOON:多任务学习的多目标正交归一化更新
- RealisticTritonBench:真实世界 AI 框架中 Triton 内核生成的评测基准
- LoSA:无需训练的视频扩散模型加速:近乎无损的稀疏注意力机制
- 针对组污染结构化结果的因果推断:可观测商、无损约简与精确随机化推断
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- 拟阵上泊松过程次模最大化的对抗鲁棒性:从鲁棒离线优化到全强盗学习
- 一个 12-CNOT 的双量子比特激发门
- 忠实、充分且可解释:通过离散扩散反演重新审视图反事实解释
- Ready Cohorts:LLM 智能体控制中的 GPU 机会边界与主机往返优化
- 可解释计算机视觉中的类激活映射:CNN、Transformer与基础模型时代视觉解释的方法论中心综述
- TailBooster:用于极限值增强与操作有效性强制约束的双层生成式框架
- 深度活动模型:用于人类出行模式合成的生成式方法
- DREAMS:基于密度泛函理论的智能材料仿真研究引擎
- 作为连续流的工具:演进式智能体推理
- HYDRA:科尔莫哥洛夫-阿诺德网络的双曲动态表示架构
- 结构性沉默:当AI基础设施辜负代表性不足语言的使用者
- 基于大语言模型的程序语义不等价博弈
- A-3PO:利用感知陈旧性的近端策略近似加速异步大模型训练
- BrowseSafe:理解并预防 AI 浏览器智能体中的提示词注入
- 教会智能体AI学习罕见病诊断的专家推理能力
- 赋能儿童:创造人工智能驱动的增强现实体验
- 大概率近似正确最大后验推断
- 增强本地大语言模型智能体的 Linux 提权攻击能力
- TMRL:扩散时间步调制预训练助力高效策略微调
- VLM2Rec:解决多模态序列推荐中视觉-语言模型嵌入器的模态崩溃问题
- 从世界模型到世界行动模型:机器人学简明教程
- 在原生 FP4 硬件上使用 MXFP4 预训练大语言模型
- 排序与分配:多视角目标关联中的指标不匹配问题
- 评估指标能检测出文言文到英文翻译中的错误吗?
- 利用智能体AI、嵌套学习以及通过语义缓存实现AI可持续性来缓解幻觉问题
- 面向高光谱鱼类新鲜度分类的域感知轻量级光谱分组卷积
- DORA Explorer:在无需训练的情况下提升大语言模型的探索能力
- LakeQuest:跨数据湖基础问答的三域基准测试
- 迈向可持续的人工智能:深度学习模型碳足迹的综合综述与比较分析
- SBCO:面向规划智能体的自监督、验证器基础测试框架优化
- CHORUS:高覆盖率测试平台激励生成的互补专家模型
- 可解码但不可拆卸:训练数据粒度决定大语言模型的参数模块化
- 利用结合语义站点嵌入的强化学习缓解公交车串车现象
- 大规模解释语言模型隐藏状态
- LinkedIn的自进化智能客服系统
- 威胁引导的策略感知场景扰动:基于在线强化学习的安全自动驾驶
- 推理捷径与价值对称性:对称性允许什么、架构实现什么以及优化选择什么
- 评估条件训练:教导模型泛化至更强的监督机制
- 面向无人机入侵检测的对话式与仪表盘式可解释AI:操作员信任与依赖性的实证研究
- 连续交互扩散:面向异步工具增强推理的扩散原生运行时
- MEGA:基于智慧图谱的自进化智能体优化基础设施
- 通过非局域性测量 SAE 特征的语义抽象度
- 先治而后连:生产级知识图谱中的身份与本体标记
- 通过年龄感知训练实现儿童语音的边缘端音素识别
- 面向分层式人类动作识别的组合式基准测试综合生成
- FITTER:时序知识图谱上与词表无关的跨领域推理
- 将相对因果知识付诸实践:基于共享结果私有报告的主干可识别性
- CLAUDE.md 为什么会不断膨胀?智能体编程中的“灾难性记忆”现象
- sLTN:结构化逻辑张量网络
- 思维链何时有效、何时失效:大模型推理中串行深度瓶颈的实证研究
- AI天气模型是否会忽略极端天气?
- FedCGR:联邦跨域生成式推荐
- 假设前沿:验证器引导的大语言模型与符号搜索用于一阶归纳
- Rescene:带限随机强迫将冻结的神经网络天气算子转化为气候模拟器
- 基于层论的联邦表示学习
- XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链
- 从预测到增量:大规模目标定位与推荐的因果优化
- 手写 PTX Tensor-Core GEMM 内核:NVIDIA L4 上的多精度研究
- ELMER:探索与优化的进化语言模型
- Comprendia:AI 增强的代码理解工具
- MRIComp4Flow:用于训练多模态生成模型的 3D 脑部 MRI 压缩
- 基于循证的科学问题发现:融合历史回测的框架
- 利用GRACE卫星数据无监督检测加纳地下水储量异常
- MazzikaAI:用于实时阿拉伯木卡姆即兴伴奏的基于知识的演奏到提示词编译器
- MemSpec:面向边缘设备推测解码自适应草稿调度的内存感知运行时
- 个性化技能能帮助编程智能体吗?开发者交互历史的实证研究
- 基于角色条件设定的大模型信息检索评估评估员敏感性探针
- 这是你的最终答案吗?跨语境一致性作为大语言模型可信度的度量标准
- FACT:世界-动作模型的故障感知因果训练
- ELVAE:基于证据学习的变分自编码器用于不确定性感知的生成
- Riemann GeoResolver:从欧几里得解析器到双曲-球面几何的非欧几里得注意力框架
- 镜前单原子:一种通用储备池计算机
- 状态关联并不能可靠预测决策泄漏
- MBA:面向现实世界商业构思的多模态基准与智能体
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- OEIS Open:语言模型能将多少猜想转化为定理?
- 你的 KV 缓存不是比特问题,而是几何问题
- 我们通过复现2200篇ICML论文学到了什么
- 双流Transformer:将主预填充路径与额外的解码计算解耦
- 大规模有限集约束解码的字典树自动机
- 正确不等于受控:智能体工作流中的溯源完整性
- 死文本还是约束条款?衡量与恢复黑盒大模型对话中的约束影响力
- ARAC:端到端科研中自动化研究对齐与完整性的基准测试
- MindMemOS:面向AI智能体的可移植自进化内存操作系统层
- 受控持久化内存:面向长周期智能体的源绑定状态语义与故障关闭释放机制
- 通过向外部大语言模型隐匿敏感信息实现保护隐私的检索增强生成(RAG)
- 预测性记忆定位:从内部信号预测选择性干预路径
- 立场:推理是一个基于规则的可学习过程
- DMDIntel:通过动态模态分解解释大语言模型
- VALG:用于机器学习理论研究的智能体系统
- 扰动响应中证据、矛盾与脆弱性的分解
- PROVE-RT:使用大语言模型为实时系统生成机械化定理证明脚本
- Moose:\(mathcal{EL}^{++}\) 中具备推理捷径感知能力的潜在概念学习
- 罕见异常失效下的解释性参与:模型行为的渐进稀疏性(或:渐进式AI)
- EEG-PRIME:基于多级条件机制和原型对齐表示学习的脑电图解码模型
- 波兰语医学视觉问答:视觉语言模型未能充分利用视觉证据
- 大语言模型中的数字能力:根本局限与改进路径
- 熟能生巧未必安全:自进化大模型智能体中的技能错进化现象
- StateBridge:大模型多智能体系统中无需训练的隐状态对齐潜在通信方法
- vToken:面向可回收 KV 缓存的Token级虚拟化技术
- 教授幅度而非方向:面向多轮多步LLM智能体的验证器有界信用分配
- 多层上下文伪装理论:面向防作弊在线评估的语义叠加与上下文叠层框架
- 开源权重模型的行为重编程:认知可塑性与对齐边界
- LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准与对齐
- 通过SLM与边缘计算增强虚拟智能体:思考与记忆过程的探索性评估
- 不求甚解的盲目模仿:大语言模型中决策偏差的根源
- 基于自适应注意力匹配的推理过程思维感知 KV 缓存压缩
- 多模态认知的层次化基于能量的模型
- QuoteBench:匹配分数如何掩盖命令路径失效
- 并非所有提示皆能奏效:AI辅助写日记中的行为可控性与阐述质量
- MARC v1:用于临床 AI 推理与协作的开源多智能体框架
- SynAct:用于自适应综合优化的推理-行动大语言模型智能体
- 超越结果奖励:面向深度搜索智能体的步级自蒸馏策略优化
- AQuA:递归自我提升的量化交易研究智能体
- PIPES:通过溯源与先验知识保障智能体感知安全
- 规范优先的AI编码智能体收敛实践:在无测试预言机、无人工代码审查的情况下,对71.7万行代码库中189个文件的核心架构不变式进行拆解的案例研究
- 快速 A/B/n 测试:通过树耦合反馈共享实现精确的多策略比较
- TEMPO:跨内存和计算瓶颈区感知完工时间的专家并行负载均衡
- 查询时机导致大语言模型与人类在位置偏差上的截然相反
- UniTraffic-Agent:2026年AI城市挑战赛赛道3的统一交通视频推理与双重跨领域评估
- 交互就绪性:构建与评估人类角色 AI 智能体的框架
- 使用 GraphRAG 将网络威胁情报投入实战
- LigBench:面向基于大语言模型的科研构思生成的统一且人类对齐的基准
- LOB-ID:通过初始距离评估合成市场数据
- EgoMonth:用于长期时空记忆的月度级第一人称视频基准
- NARU:面向日本极长视频的叙事演进与文化细微差别理解基准
- 使用双角色标识符的生成式通用多模态检索
- 保留、定制还是退出:LLM推理服务中的默认设计与代币定价
- 基于静态分析引导的智能体 AI 翻译:使 Rust 成为全栈生物信息学语言
- 基于损失引导多专家GAN的手语视频合成
- 目标函数才是瓶颈:潜在世界模型编码了其规划器无法使用的信息
- AaLLM:使用大语言模型实现从拓扑生成到尺寸优化的端到端模拟电路设计框架
- 刻意练习:在预算限制下学习机器人技能
- 训练混合:将小规模支架式预训练运行重新组合为更大的语言模型
- 合成角色预训练:从第零个Token开始的对齐
- Transformer长度泛化的代数分解理论
- DomusFM:用于智能家居基于事件行为监测的基础模型
- 科学数据高保真学习压缩的残差建模
- Vero:AI智能体能够构建形式化验证的软件代码库吗?
- 从非结构化召回转向模式接地内存:通过迭代式、模式感知的提取实现可靠的AI内存
- DFM Mimir v1:仅使用合规后训练数据、在10B参数量级实现前沿性能的开源HRM模型
- 可审计智能体:保障大语言模型智能体部署后的责任与透明度
- 揭露人工智能多智能体系统中的对话偏见
- AHD Agent:用于自动启发式设计的智能体强化学习
- DiffImaginE:利用扩散模型“想象”来验证实体类型
- 是的,Q-learning确实能助力离线上下文强化学习
- 学习型多智能体系统的延迟感知编排
- 面向格罗滕迪克常数的长周期AI研究:人机数学协作案例研究
- 公式之前的架构:超越组合图谱的神经网络架构个体化
- 相似性贯穿始终:大语言模型的多语言泛化依赖于语言层面的相似性结构
- RadarGen:基于摄像头的车载雷达点云生成技术
- 大规模遗忘:数十亿参数语言模型中的状态精确且保留轨迹的删除
- 由表及里、由远及微:基于贝叶斯推理引导的聚焦式 VLM 推理的高速公路监控视频高效远距离异常检测
- CangjieBench:在低资源通用编程语言上评估大语言模型
- Transformer 需要三个投影吗?QKV 变体的系统性研究
- SAFE-SVD:面向物理基础模型的敏感感知保真度强制奇异值分解
- SDS-LoRA:克服低秩适应中的各向异性梯度缩放
- 视觉语言模型内部伪装视觉上下文的隐藏演化
- 维度平衡提升大规模时空预测性能
- 多智能体语言模型中的道德风险
- 优化器状态究竟该存放在哪里?面向内存高效的混合专家模型训练的分层状态分配
- 通过感知I/O重构实现快速且内存高效的小波卷积
- 通过XAI驱动的数据归约实现时间序列分类的规模化扩展
- 针对大型语言模型的Unicode文本水印方法安全性与可检测性分析
- 没有通用信号能够预测版本更新下大语言模型的样本级性能退化
- 衡量语言模型智能体中的跨任务行为一致性
- 大模型推理服务的一年:工作负载演进、缓存与负载均衡
- 基于扩展假设在无标签情况下评估智能体学习框架能力
- 面向信号时序逻辑的奖励机
- MobileMem:基于一年期移动端体验的学习研究
- 你的概率式JEPA暗中其实是一个隐马尔可夫模型:联合嵌入预测学习的状态空间解释
- 揭秘智能体技能(Agent Skills):它们为何奏效——以及何时会失效
- 绝不返回具体数值:面向以事实形式消费答案的 AI 系统的结构性弃权
- 面向高能效深度神经网络推理的内存与计算频率联合优化
- 自主芯片设计中的智能体编排
- LLM预训练中领域数据重复策略的扩展规律
- 迈向高效的科技情报多模态多语言观点提取:基于 QLoRA 的微调方法
- BiasTrace:将推理行为与大语言模型的偏见输出联系起来
- 状态条件验证:用于适配与监控安全分类器的正确性估计
- 脓毒症治疗的依从性如何?用于生成临床依从性洞察的专家引导神经符号学流水线
- 面向大模型辅助模拟版图优化的仿真感知上下文策略改进
- 黎曼流形上比例类比的广义平行四边形法则
- HELIX:面向递归自我提升的模型与运行壳协同演化
- 大语言模型无法实现科学认知的‘跨越’
- 知道何时停止:大语言模型评估的贝叶斯最优停止策略
- 基于图结构的强化学习框架:用于自主LLM智能体的结构化漂移诊断与恢复
- AI科学家的过去与未来
- 并非所有 Token 都是平等的:面向智能体 LLM 系统的感知通胀路由
- 语言服务器能为编程智能体节省Token吗?测量方法与初步研究
- The Architect:在 Microsoft Excel 中交互式可视化深度学习数学原理
- 代理验证的 LLM 用户体验微模拟:早期决策支持的构件优先协议
- Tripwire:通过统计认证的安全神经元触发对齐拒绝机制
- 通过激活引导剪枝实现跨模型规模的无训练知识迁移
- SAGE:基于注意力引导熵的脉冲Transformer替代梯度自适应方法
- 字里行间:法律模拟中行为真实性的建模与评估
- 分工协作:将证据解释与决策聚合解耦
- 通过语义感知偏差估计衡量大型音频语言模型的公平性
- PPAPlace:用于芯片布局优化的可微跨阶段目标函数
- 微调 Qwen3-27B 实现 C 到 Rust 代码转换:包含预训练、调试感知 SFT 与特定任务 SFT 的三阶段课程
- CForce:通过一致性强迫提升扩散大语言模型的并行解码能力
- CutClean:面向隐私保护推理的神经网络剪枝方法
- 基于叠加DMRS与数据传输的最优功率分配及AI接收机设计
- 放大并不意味着预测性:思考模型中的推理行为
- HAM-RAG:面向结构保真交错生成的层级感知多模态RAG
- 音乐之镜:大语言模型在词曲创作中充当共鸣板
- 工程化可靠的编程智能体:评估与运维模型周边的系统
- MedClaw:面向长程手术视频推理的启发式智能体架构
- 见红则思恶:视觉语言模型中的色彩偏见
- 时间序列基础模型中的预测崩溃现象
- 用于模型合并的多目标贝叶斯优化
- 基于视觉语言模型的游戏内容叙述系统
- MACS:用于可靠对话式电商推荐的混合多智能体框架
- LP-NAS:基于线性规划的神经架构搜索
- 结晶材料的通用热力学原子间势
- RecipeNet:面向配方数据的分层 Transformer 架构
- 考虑对交通流影响的道路养护作业优化调度
- 面向大规模与高阶MIMO检测的“学习转换”(Learning-to-Transition)框架
- SkillSight:校准技能检索中的通用内容偏差
- 气象驱动的垃圾填埋场无组织排放因果临近预报:助力主动公共卫生响应
- Reflex:为反应关键型操作打造快速且具预测性的视觉-语言-动作模型
- 纠正你所看不见的错误:多模态推理机中感知蒸馏的归因问题
- 法律检索增强生成(RAG)系统的幻觉问题究竟有多严重?
- 自组织数字电路
- BUZZY:通过对比打分缓解多模态多项选择问答中的文本诱导偏差
- 面向格罗滕迪克常数的长周期AI数学研究:人机数学协作案例研究
- LUNAR:基于通用用户行为日志的个性化大语言模型基准测试
- AI聊天机器人中的广告?大语言模型如何应对利益冲突分析
- 自动驾驶中的边缘案例检测:方法、挑战与未来方向
- OTIS:使用微型编码器学习高质量时间序列特征
- 重新定义视觉领域的泛化能力:基于 FusionDetect 的双轴虚假图像检测框架
- 迷失在发声中:将声音质量变异作为语音基础模型评估维度
- 利用少样本学习与大语言模型分析科学文献中不同生物学性别的血压变化
- ArGEnT:用于算子学习的任意几何编码 Transformer
- AtomBridge:面向科学实验长程任务的智能体化 VLA 推理插件
- 用树结构打破链条:具有 \(mathcal{O}(log N)\) 时间复杂度的模型并行深度学习
- 被动物体状态世界模型中运动学、接触及物体恒存场的事件条件诊断
- 迈向医学影像无监督域适应的实用算法选择
- 提升多模态 RLVR 的泛化鲁棒性
- Kalypso:关系型大模型推理服务系统
- 通过置信度动态实现大型推理模型的提前停止
- 利用大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法
- 多轮大模型推理的自适应停止策略
- AI智能体能够模拟A/B测试结果吗?智能体实验验证框架解析
- TEMPO:面向内存与计算受限场景的专家并行负载均衡调度器
- 快速 A/B/n 测试:通过树耦合反馈共享实现精确的多策略对比
- 从代码评审到代码批判:大规模 AI 生成差异的意图、偏移与聚光灯机制
- 预测性记忆定位:从内部信号预测选择性干预路径
- 大语言模型在医学推理中展现出元认知敏感性
- 何时通信:多智能体强化学习中有原则的门控机制的信念分布与KL散度
- LLM智能体能进行理性谈判吗?基于A2A/MCP协议的可验证多智能体交互机制设计框架
- 幻觉雪球效应:将多智能体大模型流水线中的错误传播建模为状态转移
- 无干净参考集的智能体数据清洗:能力与权衡的实验研究
- 同步 Logit 引导:现实世界中的隐写术
- 通过建议渠道实现的个人赋权剥夺:内生影响力下的控制权丧失
- 观点:科学团队中的AI智能体应作为人机系统进行研究
- 迈向安全的LLM智能体:规范、验证与执行综述
- 个性化自动研究:迈向真正的 AI 共同科学家
- 大语言模型知道该问什么以及何时发问吗?多轮信息搜寻能力评估
- MINT:用于平衡多目标对齐的最小选择偏好蒸馏
- 工具返回结果比纯文本更具权威性吗?基于 Claude Opus 5 针对合成赋值任务中虚假声明采纳的三项前瞻性研究
- 大型低轨星座应急对地观测的任务驱动三层分布式调度方法
- 汇聚而非准入:注意力机制如何将潜在变量转化为可表述形式
- StateM:通过大模型外壳扩放(Harness Scaling),在 Terminal-Bench 2.1 上达成 95.3% 的原始准确率与 15 美元的极致前沿运行成本
- SCOPE:面向视频世界模型的评分隔离智能优化框架
- 超越阈值:面向冷链物联网系统的质量感知决策智能框架
- 思维漏斗:通过早期投票与推演剪枝实现高效的测试时缩放
- 机器智能的构成先验:人工物理世界的合法性理论
- SkillCommit:通过行为验证的范围扩展实现智能体技能演进
- ReForge:利用经过验证的大语言模型修改,让ABR算法持续演进永不过时
- 使用 CPMpy 将有限域整数约束模型翻译为 CP/SMT/ILP/PB/SAT 求解器
- 量化智能体剖析:代码合成智能体工作负载中的显存稳定性与预测
- 面向人类状态跃迁的生理学世界模型
- MoE 路由引导的异构联邦指令微调聚类方法
- 分歧-收敛推理:通过结构化解决方案合成扩展测试期计算
- 在独立各位置方向偏移下的旋转不变性多IMU活动识别
- 基于大语言模型智能体及列间约束发现的约束感知合成表格数据生成
- 面向小型设备的超大模型:边缘AI部署的近期进展与实证分析
- 超越正确性:基于 Lean 4 实现自动化新颖性验证
- KV-Rescue:通过逐步交织恢复推理语言模型的KV缓存淘汰损失
- 运行时压缩风险定价:压缩服务状态的随时有效准入与服务输出定律
- CoupVisor:基于回合与质疑决策支持的策略优化
- PLeDO:基于电子病历数据的骨关节炎疼痛程度检测
- 从通用走向专业:利用冻结视觉语言模型实现内窥镜息肉报告的上下文融合框架
- 大模型拒绝机制中的对称性破缺:答案释放比恢复拒绝更具局部性
- RAGas:结合持续知识集成的智能合约检索增强Gas优化方案
- ATLAS:基于嵌入引导质量多样性搜索的LLM无支架算法合成
- 无需求解器的可解推箱子(Sokoban)生成:基于扩散模型的方法
- 大语言模型赋能的社交媒体机器人检测系统的攻击与防御
- 亲爱的算法:用于统一搜索与推荐的注重精度优先的智能体意图层
- 蛋白质结构预测:从进化约束到生成式建模
- BaT:基于阶段评分准则的自进化医学研究智能体
- 有界智能体:多智能体AI系统的委派安全性
- 上下文压缩给AI智能体带来了什么代价?被任务完成指标掩盖的交互成本
- AstronOS:面向长视野智能体系统的统一执行模型与运行时
- 基于推理的汽车电子电气部件鲁棒性验证
- AeroCopilotBench:在交互式虚拟座舱环境中评估大模型智能体作为航空副驾驶的双层基准
- 提示词的价值:一种大模型相对柯尔莫哥洛夫复杂度的方法
- DeepInsight II:从基准测试到机器人的完整追踪
- 当熵不再足够:在大模型输出长度预测中找回丢失的语义
- 智能体物理学:统计力学预测人工智能群体的集体行为
- 概率电路:人工智能中的推理机器(第一部分)
- Chronocooked:强化学习智能体隐式区间计时基准测试
- GRIP:基于信息受限前提的扎实推理
- 轨道AI计算:不同卫星规模下的碳排放权衡
- 多模态生成式模糊系统:模糊推理引导的大模型交互式问答框架
- 面向混合架构的视觉-语言-动作模型高效块级并行推理
- HarmProfile:刻画前沿大语言模型中的有害分布
- Wiola 13M:面向参数高效小型语言模型的门控螺旋注意力架构
- 前向传递域自适应(无需跨层反向传播)
- 通过数据规模化突破高分辨率天气预报的极限
- 停止全精度索引:重新审视向量嵌入的聚类方法
- FedImp:基于杂质度加权的联邦学习收敛性增强
- 半导体工艺动力学的信息论因果建模
- 你的注意力指标究竟在回答哪个问题?作为成分数据的注意力行
- 使用3D生成式AI从基线MRI合成烟雾病术后乙酰唑胺脑血流图
- 通过在线自蒸馏缓解大模型评判中的评分标准干扰
- 切合个人实际:通用 SSL 表征在真实生活 PPG 情绪检测中的局限性
- DumpsterCluster:从“垃圾堆”到运行 LLaMA-70B 的 60 美元 GPU 集群
- 自动还是受控?重复启动效应揭示了基础大模型、指令大模型与人类的思维处理分化
- 通过可解释神经网络揭示纳米晶合成的尺寸决定机制
- PolyComp:用于评估多模态模型组合式 3D 空间推理能力的基于多方块立方(Polycube)的基准测试
- 开放策略独裁者博弈:相互透明环境下的合作
- GaussMemory:面向长序列机器人操作的任务驱动型 3D 高斯场景记忆
- 人工智能作为打击童工的工具:用于儿童检测与年龄估计的实时边缘视觉流水线
- 长周期多智能体大模型商业环境中的涌现性错位通信
- 低秩动力学有效潜在载体:用于学习世界模型中反事实推演的方法
- 从大模型推理到智能体工作负载:服务系统的特征分析与启示
- VTInstructor:用于连续环境中导航指令生成的视觉轨迹提示方法
- VGGT-Align:架起长序列三维重建中局部重建与全局一致性的桥梁
- CG-GLORE:用于稀疏视角CT重建的基于共轭梯度的全局-局部正则化网络
- 形状算子主成分分析:面向几何机器学习_曲率感知投影
- Max-Q 选择性模仿:用于人机协同在线机器人学习
- 当AI重写,分类器放松:针对讽刺与AI释义社交文本的不确定性感知的正面/负面情绪分析
- MAPLE:MoE 自适应即插即用层级专家分配框架
- 外表可能具有欺骗性:众包航空灾害评估中跨影像来源的标注者与审核者表现
- 针对一个模型封闭,对另一个模型开放:法律多项选择基准测试中的“纯选项可解性”
- 用于论证分析的逻辑嵌入
- 视觉-语言-动作模型的比特翻转攻击:动作解码架构决定漏洞脆弱性
- AudioTQ:一种基于随机哈达玛变换与Lloyd-Max量化的6位CPU音频编解码器
- ETHOS:面向临床多智能体系统的模块化伦理框架
- MistyPilot:通过多智能体大模型技能编排实现社交机器人控制
- 评估工具对人类和大型语言模型(LLM)测量的是同一事物吗?一项潜在结构分析
- 稀疏原型代码构成了跨模态分类与预测的基础
- 当故事演进时:开放式世界模拟中大语言模型叙事能力的基准测试
- 解构推荐系统中的内容陈旧度:用于替代与衰减的双滤镜框架
- FluxBin:通过算法与算子协同实现基于灵活查找表的超低比特大模型推理
- GraniKV:针对具有长共享前缀的多智能体系统的非对称粒度KV缓存分页
- Kozuchi Agent:用于软件修复的语言无关开源权重智能体
- 在仿真中预训练视觉灵巧操作
- 面向超高分辨率遥感图像分割的分层自适应特征精炼网络
- 利用图神经网络表征心脏组织特性
- 基于认知动机的隐喻解释多维评估框架
- CM-MAE:面向视觉-无线应用物理机理引导的跨模态自监督学习框架
- 一种用于大模型教师蒸馏标注的可扩展流水线:工作窃取任务调度与内存感知 GPU 并发
- 肺癌组织病理学深度学习架构的综合基准测试
- TinyCast:基于计算周期的概率化零样本预测模型
- RetroMPA:用于增强逆合成预测的分子属性感知辅助框架
- TokenSTFormer:用于青少年特发性脊柱侧凸筛查的整体运动分析分词时空注意力模型
- OceanLight:基于几何自适应非结构网格表示的高效全球海洋预报
- AsyTO:用于参数高效的多变量时间序列预测的不对称时间算子
- CAPO:大语言模型智能体的约束感知提示词优化
- 迈向无风险的AI智能体部署
- 文档计数不等于文本计数:Web-PDF 语料库统计中的单位偏差
- 图机器学习:电力系统的新机遇
- 深度思考对齐:用于视频推理的轨迹级潜在蒸馏
- Foresight-England:新冠疫情期间用于医疗事件预测的国家级电子健康记录生成式AI模型开发
- 结果一致而视线分歧:具中心凹视觉的多模态大模型如何进行视觉搜索?
- CompoSkill:由单个扫描通过的LLM智能体技能构成的组合式技能链攻击
- MLLM引导的文本转视频生成语义纠错
- PertMind:通过细胞扰动数据强化学习激发大模型的涌现生物推理能力
- GxP-Agent:用于基于大语言模型智能体实现可靠临床试验编程的进程有向无环图拓扑
- 面向智能体AI的运行时治理:具有可信溯源与故障安全执行的动作边界控制
- 愚人金:针对开源模型去安全化攻击的防御性欺骗策略
- SignalReasoner:评估3B模型在信号数学推理中的性能上限
- 面向忠实知识图谱推理的结构内化规则语言模型
- 综合特征提取器:用于算法选择的智能体方法
- PlanPO:面向多轮智能体大语言模型的群组规划感知策略优化
- Wuying-Browser-Agent:面向真实世界的长周期基础浏览器智能体
- TRUSS:迈向任务可靠与用户安全的自动化智能体技能生成
- GraphWake:基于大模型智能体社区中记忆介导的极化级联效应引发群体极化
- 面向关键任务基础设施运营的LLM智能体任务感知约束适配
- 混合专家(MoE)模块包含强有力的幻觉检测信号
- 基于推理的编译至可微分电路:实现基于OWL 2 DL的神经符号学习
- 何时复习:语言模型持续预训练的间隔重复机制
- 超越推理轨迹:将可解释的推理状态读出模块与原生 MoE 路由进行耦合
- 通过程序搜索与持续抽象发现实现程序化内容元生成
- DecPOMDPs 爆炸难题的奇案:通过策略计数实现“防火墙”
- 大语言模型能解释飞行安全事件吗?一种先验引导的语义大模型方法
- LEGO-RL:面向代码智能体的原生基架强化学习
- StagedWorkspace:面向知识工作智能体的版本化工作空间
- HLSR:面向实时拥堵规避的混合实时预测选择性动态车辆重路由
- 编码代理的工作集:代码库规模任务中的一致性债务
- 在安全调查中使用和评估大语言模型作为替代专家的框架:可靠性、偏见与影响
- 意图驱动的动态分块:基于预测信息需求的文档切分方法
- PXDepth:用于保持结构特征的单目深度估计像素空间建模
- 图手术与 do-算子:无环结构因果模型的精确对应关系
- 在上下文之前授权:针对智能体系统中跨受众内存泄漏的模型中立受众边界
- 结合世界模型的Q学习 (Q-Learning With World Models)
- 超越可疑步骤:长程智能体的本体论信任
- 确认点即系统:面向AI审计证据的持久化策略决策回执
- 多智能体AI工作流中的Token优化与上下文窗口管理
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- 通过跨难度优化动力学理解大语言模型中的课程学习
- 基于确定性几何与受控智能体视觉语言优化的结构图纸转模型方法
- 从基函数的视角重新审视不规则时间序列预测
- 学习不该学的内容:用于鲁棒视觉-语言模型的对抗解耦提示微调
- PTXBench:利用架构专用 PTX 评估与适配大语言模型以进行 GPU 核函数优化
- SemComp-Bench:视频生成中的语义任务完成度基准评测
- 探究预填充阶段:通过潜在激活检测代码漏洞
- DMT-Dens:面向生物学数据的密度保持流形可视化
- 无需高斯假设:面向 JEPA 世界模型的对比逆动力学
- CoAL-RAG:一种兼顾复杂度感知的法律检索增强生成方法
- 聚合评分的盲区:衡量商业大模型API迁移中的项目级性能退化
- 面向CSI反馈的Learnware:场景专用小模型如何发挥巨大作用
- MotoSafety:利用学习型时间重要性在时间压力下进行两轮车碰撞风险评估的边缘AI
- 已编码但无法利用:冻结大语言模型中几何约束的“解码-生成-引导”鸿沟审计
- 自动化安全补丁向后移植基准测试:我们距离成熟还有多远?
- 通过大模型引导的强化学习实现高效个性化AI导师
- 使用合成数据训练热红外图像中的无人机检测
- 学生与AI交互中的提问类型分析:一项针对两项CS2任务的案例研究
- BEAR-Bench:面向多模态模型的双语企业与学术推理基准
- 从学生风险预测到SC2R:面向教育决策支持的语义约束反事实归因
- 评分需要的是评分标准,而非大模型的智能
- 为什么 GPT 风格模型无法直接迁移到符号音乐:错误坐标系下的压缩问题
- 集体反事实规划:表征约束下的协调、同意与验证
- 利用幅度与复数测量结合学习先验提升动态磁共振成像重建性能
- ScreenSearch:具备不确定性感知能力的操作系统探索系统
- SIGMA:面向无元数据 LLM 自动特征工程的 SHAP 引导隐式轨迹生成
- TSQueryBench:用于时间序列解释的大模型裁判评测基准
- Distribird:基于文献信息的贝叶斯模型校准先验分布设计
- 盲目的策展人:有偏见的评判者如何悄无声息地阻碍自进化智能体的技能淘汰
- 上游决策,滞后执行:定位并评估多语言混合专家模型(MoE)的跨语言拒绝回路
- 扩散模型赋能更聪明的无人机:决策与建模
- 大模型引导的图生成方法用于基于结构的局部改进优化
- G-ReAct:基于结构-状态协同演化的图引导深度搜索
- LZ 惩罚:自回归语言模型的一种信息论重复惩罚机制
- FormalAnalyticGeo:基于神经符号架构的多模态解析几何题目生成框架
- 异构边缘-云连续统中的自适应人工智能任务划分与安全卸载
- 量化线性映射的亚高斯性:一篇AI辅助的数学手记
- 倒排索引遍历的 \(mathbf{P}\)-完全性:布尔查询 DAG 评估的计算复杂度研究
- BRo-JEPA:在潜空间中学习模块化变换
- 从实验与模拟的不一致中发现物理机制
- FVSpec:将现实世界的基于属性的测试转化为 Lean 挑战
- 标准可解释模型:利用拉格朗日力学演绎设计可解释机器学习方法的通用理论
- 人类评估中的真实性鸿沟
- Agent libOS:面向受能力控制的自进化大模型智能体的运行时底层架构
- 12-CNOT 双量子比特激发门
- UltraArUco:一种用于移动端增强现实交互的轻量级多语言低延迟实时标记追踪库与框架
- FUSE:基于面部视频的帧统一应激估计
- HMS-SCP:面向车路协同感知任务导向的多尺度语义通信
- CLAIR-Fin:用于跨模态金融问答的声明级验证与自适应辩论对抗性多智能体框架
- 基于物理基础的端到端驾驶规划器因果审计
- Palmyra x6 技术报告:基于锚定监督微调的智能体与工具调用模型
- 人工智能语言表征中:虚假(Falsehood)与不可能(Impossibility)指向不同的方向
- Search-G1:基于表征内在奖励的扎根搜索智能体
- 自进化智能体作为动态图变换:综述与新视角
- GenEx:通过密码子共现网络进行SARS-CoV-2变异株检测的基于图的表征范式
- 解题不等于画图:奥数几何图示推理基准
- 衡量部分得分差距:越南2025年凸性评分方案的严格基准测试
- 关于任意格中 Jaccard 距离三角不等式的研究
- RDFdL:将 RDF 与微分动态逻辑相结合
- 治理记录作为监督:用于结构化工作流修复的验证器选择自训练
- 通过形式化抽象提升资源受限语言模型中的自然语言组合优化准确率
- ComponentBench:诊断电脑操作智能体的组件级故障
- 轻量级多模态模型能评估大语言模型的推理性能吗?面向计算最优文档推理的研究
- UMER:通过面向对感知的判别推理统一通用多模态检索的嵌入与排序
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 候选状态记账法:实现透明的传感器诊断流水线搜索
- SkillGate:长程智能体中策略内技能选择的训练方法
- 超越文本记录:检测潜在多智能体通信中的隐蔽协同
- 自我与他人标签在LLM裁判中引发双向偏差
- 面向低资源非洲语言的潜空间拒绝锚定:无需重新训练的机械式安全恢复
- 分数衰减 KV 缓存:面向对话系统推理相关性优化的所有权感知内存管理
- 通过拒绝别名缓解消融攻击 (Abliteration Mitigation via Refusal Aliases)
- 调校随机机器:人机工程学系统工程师操作模型
- 言语过度自信的不同面相:一项可解释性研究
- 基于时序多信号融合的Token级幻觉检测
- 大语言模型无训练推理时自我反思与成本受限早停机制
- 熵约束自适应随机量化
- 大型语言模型中的机构声望与地理偏见:来自带有自助法置信区间的三个析因实验的证据
- 面向持久化机器监测的低功耗神经形态声学异常检测
- 是什么让软件问题解决任务对智能体来说如此困难?
- 大语言模型何时真正有效?评估 LLM 作为数据质量标注工具的效能
- 相同事实,不同更新:推理设置如何塑造大模型在医疗资源分配中的行为
- LEDGER:用于审计 LLM Agent 的声明-证据追踪图
- LLaMA 3.1 8B 中结构感知数值推理的机理可解释性研究
- TTSD-FAR:面向大型视频-语言模型中缺失模态情感识别_带有费雪锚定恢复的测试时自蒸馏方法
- 划分支撑集,重建残差:面向视频生成与世界模型的免训练稀疏注意力机制
- 心理健康教育人工智能:用于自动化临床督导与风险分流的三流微调大模型框架
- ERASE:用于现代推荐系统加速训练的早期反向传播调度方案
- 基于形式化探索与神经符号细化的覆盖率驱动 RTL 断言生成
- 单一网关远未足够:为智能体AI组合有状态的前置动作控制
- 利用交互作用评估与解释大语言模型的提示词敏感性
- 机器上的机器科学:计算化学中的AI智能体
- MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映
- OmniHandwritingOCR:用于评估多模态大语言模型手写OCR场景的诊断性基准
- 面向无线场建模的物理展开神经算子
- MorphoGP:预测潮汐影响下平衡海滩剖面的非参数框架
- 遗忘、可塑性与协同观测:持续学习的第三维度
- 网格细胞在减少海马体位置表征空间混叠中的作用
- GCNO:用于无线信道物理压缩的格拉姆切比雪夫神经算子
- 罗马诺夫三元组逻辑的形式化验证:用于滑动窗口3-CNF的验证过滤器及其在结构化公式中的应用
- 只需少数几个样本:MedSAM3高标注效率LoRA微调的实证研究
- MLREF:利用大语言模型实现强化学习奖励设计的模块化高效重用
- 学习状态感知的面向小规模数据集动态生成式数据增强
- 伯恩斯坦-瓦齐拉尼网络:通过干涉实现的量子机器学习
- 野外测试时扩展:为什么“开发”而非“探索”才是瓶颈
- rEDMRec:将大语言模型推理蒸馏为可编辑的推荐经验记忆
- 从威胁情报到检测:基于知识驱动增强与模板化规则落地的自动化 Sigma 规则生成
- GS-VLA:基于高斯溅射的冻结 VLA 策略即插即用视点归一化
- 面向英特尔 AI PC 集群的分布式大模型推理预编译流水线分片技术
- 拦截袋鼠:基于人工词库、主动探查以及利用大语言模型作为信息提供者与假设提出者的实验性星际语言学
- 叶节点值作为坐标:梯度提升集成模型的精确对比解释
- RULER:机器遗忘的表征级验证
- 从多智能体到单智能体:什么时候技能蒸馏才真正有效?
- 不完美对齐下的价值脆弱性
- ADEPT:通过强化学习的预训练与后训练加速机器人灵巧操作
- 大语言模型用于Verilog代码生成:文献综述与未来之路
- 基于张量分解的导频受限MIMO信道结构化估计
- SkillForge:面向特定项目问题解决的自我蒸馏智能体
- 野火扑救:计算复杂性、数学模型与实例基准
- 何时将苹果称为红色:人类遵循内省规则,而视觉语言模型(VLM)则不然
- S2-MoE:在边缘设备上实现高效的混合专家模型自推测解码
- 通过全视界压缩循环实现符号音乐语言模型整曲训练
- MedStruct-S:面向OCR临床报告的键发现、键条件问答与半结构化提取基准
- VibeWorlding:多模态智能体能否端到端构建3D开放世界?
- DELOS:用于Kepler光变曲线低信噪比盲搜的对比深度学习方法
- RouteCost:一种受生产实践启发的电商预购运费估算多阶段框架
- 不可训练元件决定了物理学习的记忆内容
- 语言模型微调中的幽灵相变:密度矩阵分析
- 揭秘数据受限下语言模型预训练的训练时数据增强
- EgoCITE:面向长时序第一视角记忆的上下文增强索引与时间感知检索
- 衡量依赖鸿沟:诊断表格生成模型中的列间保真度
- 从序列到结构:面向大模型智能体的关系不确定性传播
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- 基于目标侧阅读器适配的跨模型记忆迁移
- 面向长文本自动驾驶的规划对齐 Token 压缩
- G-ReAct:通过结构-状态协同演化实现图引导的深度搜索
- TestifAI:基于层析成像的深度学习系统测试方法
- 可解释架构的图形化设计
- 我的 agent.md:如何利用它提升大模型辅助编程的代码质量
- StateSight:基准测试视觉语言模型中的潜在空间状态重建
- PrimeAgentOrchestrator:面向个人 AI 基础设施的记忆预加载智能体衍生系统
- 检索失效于开始之前:智能体记忆中作为保持失败的结构性间接前置条件驱逐
- Nexus:面向统一内存中智能体大语言模型的深度自适应 KV 缓存拼接与检索解耦工具路由
- 环境、智能体及联合智能体-环境系统的世界模型
- SAGE:SQL中AI函数的统一代数与自适应执行
- 加权记忆树:为长程 LLM 智能体保留关键信息
- 终端智能体:命令行环境下的 AI 智能体综述
- Why2Speak:拒绝行动策略的忠实推理
- CAS:通过自适应检索与策略加权的保形智能体搜索
- VortexChat:用于自主多目标集成光子设计的智能体框架
- 已知而言:通过召回锚定蒸馏防止大语言模型监督微调中的事实访问失效
- 一种用于智能洪水响应的时间规划方法
- 动态上下文调度:超越静态宇宙的学习
- 通过组合边界与安全性持久性实现大模型安全性的认证多轮鲁棒性
- RAG 亟需建立索引:为什么写入时编译优于查询时解释
- TRACE:基于多源证据溯源的代理式商品目录增强框架
- 科学声明能从大语言模型中移除吗?声明级遗忘的系统性评估
- SENTRY:面向IT变更管理的确定性智能风险评估
- 从注意力掩码到惯性零向量标记:OAttention 与 O-Closure 标记动力学
- CLEAR:用于保持模型效用的连续潜在适配器路由大模型安全对齐
- TreeWY:门控DeltaNet混合模型的投机验证
- 通过注意力头干预实现大语言模型中的个性化隐私控制
- 不要解决,只需比较:用于LLM智能体运行时干预的微型顾问
- 信念而无行动:评估视觉语言模型中心理理论向协同社会行为的转化
- 凸集图上斯坦纳旅行商问题的统一分支定界搜索
- 迈向自动化研究:利用具有范畴结构的论文知识图谱挖掘可证伪的研究构想
- 临床长文本推理的抑制性注意力机制:电子健康档案处理中迷失在中间效应的表征与缓解
- 解剖学先验信息神经网络:在损失函数与网络架构中编码解剖学先验,并结合SE(3)公式建立导丝诱导的腹主动脉髂动脉变形模型
- 语言模型认为谁更有能力?职业偏见的机械可解释性分析
- 基于边缘计算的代理式检索增强生成技术:用于联邦公路管理局(FHWA)桥梁检测合规性
- Ansari:一个基于检索增强的伊斯兰AI助手——14万次对话的架构、部署与经验教训
- VA-DPO:用于语言模型可控情感生成的效价-唤醒度直接偏好优化
- 大型语言模型在疟疾药物发现中的严谨评估:性能、规模与资源效用的权衡
- 大语言模型何时能替代微调的 NLU?生产环境中意图检测的决策框架
- BF1:面向高效长文本 Transformer 的因果二元稀疏注意力改造方案
- 当词汇理解失效于临床推理:评估治疗型聊天机器人针对Alpha世代的安全风险
- ARQ:用于C/C++漏洞检测的智能体CodeQL查询优化框架
- 同行投票LLM智能体压力测试:发现信息流诱导的词汇趋同,但分布式来源并未带来可靠的匹配曝光优势
- 当故障发生扩散:智能体检索增强生成中的因果故障归因
- 用于家禽养殖福利约束控制的混合边缘云数字孪生系统
- 利用空间望远镜数据与生成式AI增强数字巡天的成像能力
- 一维二次曲面上 Adam 优化器稳定性边缘(Edge-of-Stability)的可证明性
- AgentMercury:让你的智能体在大规模业务场景中自主合成可验证环境
- 真实软件历史中的时间有效性:基于GitHub修复消除代码助手记忆中的陈旧事实错误
- 语音大模型会听从自己的观点吗?诊断并缓解流式情感理解中的先验信念污染
- 结构化但脆弱:论大语言模型在网络安全决策中的局限性
- 身份感知的人机交互动作描述生成
- Meta 如何确保部署安全性:持续变更安全性的健康检查机制
- 目标感知的校准数据选择:在量化语言模型中保持不确定性
- BC-Bench:评估面向 ERP 领域特定语言的智能体工程能力
- HIERA:针对GPU内核优化的跨实现空间工作负载感知规划
- CIVA:针对视觉世界模型智能体的评论者诱导价值子空间攻击
- 拒绝双关:用于以人为中心的LLM评估的合理未知姓名(PUN)
- 感知量化修复:恢复压缩版 4-bit 大语言模型的实用方法论
- TurboBias 2.0:面向生产级高效 ASR 系统的流式上下文偏置框架
- 迈向残余听力损失研究:新型耳蜗OCT数据集中的纤维化定量分析
- 锚定正则化直接最小二乘法(ARDLS):整合既有优先级算子以实现层次分析法中的权重提取
- 具备权威性的AI:从应用层到硅片
- 效用遭受攻击:智能体记忆投毒与内容筛选及溯源排名的局限性
- ACQ:大规模在线广告中自动化创意配额分配的落地两阶段框架
- 牛顿法的原始加速
- WorldLines:长时序具身状态智能体的基准测试与建模
- AgRefactor:用于高层次综合(HLS)兼容性与性能的自进化智能体工作流
- 言语无害而行动致命:在隐状态风险空间中探究超越文本越狱的物理越狱
- 大语言模型能够进行内省吗?一项现实检验
- LongRCA Bench:诊断长程智能体失败中的责任角色与根本原因
- 学会何时思考:用于测试时计算分配的自适应推理
- 归因光谱基础模型中的预处理不变性
- 神经影像分析中的SPD矩阵学习:视角、方法与挑战
- 大尺度推荐解释中“大模型即裁判”的生命周期管理
- KernelArc:面向GPU内核优化的多智能体框架
- 通过查询覆盖率与声明可验证性实现与查询无关的 RAG 评估
- 用机械可解释性解释内在的道德自我修正
- GeoExplain:基于街景视觉信息层级的多模态推理
- DECOWAM:面向四足移动操作的解耦式全身世界-动作模型
- CulTrace:追踪大语言模型内部的文化推理过程
- RefusalGuard:大语言模型中保持几何结构的安全性微调方法
- 微调心电图基础模型以预测冠状动脉CT血管造影结果
- 面向工具使用型大模型智能体的完全循环子任务图:长程工作流中的灵活性、成本与瓶颈
- S-AI-Recursive:收敛递归推理
- GRALIS:融合联盟与梯度归因,具备闭式守恒误差与有限样本保证
- DF3DV-1K:无干扰新视角合成的大规模数据集与基准
- 基于偏好的自蒸馏:通过奖励正则化超越 KL 匹配
- 面向卫星视觉Sim2Real数据构建的组件感知保结构风格迁移
- INFUSER:影响引导的自我进化提升大模型推理能力
- 大语言模型角色双重性:聚合倾向与框架依赖几何学
- DFM Mimir v1:仅使用合规后训练数据、在10亿参数规模下实现前沿性能的开源HRM模型
- 重要他人 AI:作为长期关系智能的身份、记忆与情绪调节
- 病理基础模型的分布鲁棒性边界
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- 用双判别器分离协变量漂移与机制变化:具备精确协变量-概念分解的条件差异度指标 CJSD
- 看起来对,运行也对:多屏幕移动应用生成的项目级基准测试
- SuTRA:具备词根感知能力的结构统一分词算法
- 模型坍塌与应对策略综述
- KVBoost:基于偏差引导重计算的块级键值缓存重用技术,助力高效大模型推理
- Hugging Face Inference Endpoints、Jobs 和 Buckets 如何驱动 Papers with Code 的搜索功能
- SchemaRouter:面向高效异构智能体 RAG 的字段感知工具路由
- 量化地理域偏移以解耦人类移动流生成模型的空间可迁移性
- 弃权协议:Clos 网络架构的根本原因分析 (RCA)
- 没有中立的评测框架:现代大模型排行榜是由配置脆弱项构建的
- 使用 QHAdamW 优化空气质量预测中的增强型人工神经网络
- SAEM:用于思维链推理中内存高效 MoE 推理的阶段感知专家管理
- 在区域内部生成而非在边界上:LTN-GAN 中硬约束的函数符号基础
- 衡量大语言模型中的激活控制能力
- 时间序列分类中可解释人工智能的软件框架:系统性综述
- 语义压缩树:通过分层语义残差实现多分辨率知识检索
- 提示、评委与教师:视觉语言数学推理中稀疏奖励强化学习的先验注入
- 上下文即环境:面向长程智能体的程序化上下文管理
- 让信用跟随计算:面向大语言模型强化学习的架构感知信用传递
- 罗马乌尔都语仇恨言论分类:参数高效微调与提示工程的比较研究
- 从 SQL 生成到工具选择:一种面向领域的 MCP 服务器模式
- 乳腺癌多学科团队会议边缘AI医疗器械系统的开发与可行性评估
- 小型视觉语言模型在定性力学问题上的评估
- MEMONDEMAND:面向大规模企业数据的内存管理系统
- HIRA:面向受监管行业文档分类的人机协同检索增强级联系统
- LLM4LLM:通过闭环智能体优化弥合内核基准与真实部署的差距
- DynaContext:异构参数提取中优化提示词的自改进动态上下文构建方法
- 小型推理模型在函数调用中即为指令遵循者
- 少读多解:面向AI智能体的Token高效稀疏阅读技术
- 基于查询的长文档多模态信息抽取
- 解决可解释人工智能中的选择问题
- HERO:用于长程智能体记忆的人类画像增强检索优化框架
- 超越视觉所见:揭示多模态大语言模型的情境错觉
- 自动驾驶课程学习的规模化扩展
- HANSARD:面向自主多智能体AI系统的取证就绪、运行时见证与分级归因参考架构
- 大语言模型用于问卷文本分析:人类与 GPT-5 在归纳式内容分析上的性能比较
- STAGE:基于策略限定上下文与确定性控制的有状态转换至智能体图执行
- ClawProBench:AI 代理的轨迹感知评估
- 弱监督概念瓶颈学习:实现鲁棒的两阶段以物体为中心的视觉推理
- CAI-DLLM:扩散语言模型的收敛感知推理
- 基于大语言模型的虚拟人言语与非言语行为不一致性选择
- 长运行 AI 智能体内存中的“压缩悬崖”现象
- DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习
- 受限预算的具身感知:四个资源壁垒与31B以下开源模型上访问结构化感知的预注册评估
- PsychJail:通过大模型策略的多轮说服探索心理学越狱
- PatchWrite:一行而非一节——面向AI撰写文稿的编译门控与有效性保持编辑框架
- 深陷文本负债:面向MLLM智能体的视觉证据保留上下文剪枝方法
- 人工共情:迈向无监督智能体检测与策略重构的框架
- 从生成到模拟:世界模型距离真正的模拟器还有多远?
- AgentWeave:在工具丰富的语言模型中,通过先路由后推理实现高效函数调用
- 特定领域大型语言模型在回答精神病学患者咨询中的表现
- 从惯性到客观:通过噪声隔离改进深度研究智能体
- 漫步黑暗面:使用 DARKSIDE 进行逻辑增强生成与连贯性审计
- SRPO:面向长视野推理的自反思策略优化
- 当今数学是什么,未来又该走向何方?
- 从超声报告提升 O-RADS 风险分层:混合推理与端到端大模型推理策略的比较评估
- 隐藏在请求之中:通过词元相关性解释不道德的大模型依从现象
- 基于布卢姆分类法的超推理模型推理轨迹认知剖析
- Wazobia Eval:尼日利亚皮钦语情感理解、讽刺检测与文化推理基准
- 修正随机森林的变量重要性评分
- RoboShape:面向隐私感知机器人感知的基于信息论的点云表征
- 智能体脚手架会放大大型语言模型的谄媚行为
- EarthVerse:跨动态地球系统与自然灾害的科学智能体基准测试
- 模型之模型:何时输出专家模型能胜过注意力机制、自适应或微调?
- 纠正学到的物理不变量可改善世界模型的前瞻推演
- 通过反事实集成解码减轻大型视觉语言模型中的偏见
- 超越每字母两字节:西里尔文 AI 系统中的分词开销
- 锚定偏差:面向持续学习的多模态大语言模型持久性公平后门攻击
- 权重中被遗忘,工具中被找回:大模型智能体的工具去学习
- 构建用于基于人工智能的连续环形撕囊术技能迁移的预测性手术路径
- TinyML 系统的功耗与性能特性分析
- 运行级数字孪生诊所:实现具身智能基于任务的评估
- 基于良性事实的强化学习会放大对已记忆隐私数据的泄露
- GUI元素定位中的词汇耦合:句子嵌入在移动端与Web端的标签追踪表现
- 为什么是这个而不是那个?通过挖掘用户画像实现成对反事实解释
- 架构作为代码Agent的能力均衡器
- 读、写与松弛:为什么神经偏微分方程代理模型需要同时具备全局与局部处理能力
- 可缩放矢量图形的潜在空间
- HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化
- 语言模型中的评估意识:表征、言语化与控制
- LiteEvent-AE:面向低延迟、受限能耗边缘设备的事件相机轻量级自编码器
- 更多计算资源无法确保更高的学术影响力:来自自然语言处理顶会论文的证据
- Meta-Ctrl:通过解耦语法与语义约束实现有保证的计划生成
- 打破假设:针对语义攻击对输入侧越狱防御机制的审计
- EDGE:智能体强化学习中引导式探索的经验蒸馏框架
- 词汇扰动破坏大模型推理:注意力转移的实证研究
- 基于上下文学习预测漏洞严重性:一项工业级案例研究
- OVIBench:面向中断场景的在线视频问答基准测评
- 利用非绑定自条件机制改进少步语言流模型
- 针对未见问题的LLM评估:上下文多维项目反应理论模型
- 解码前声学分诊:面向预算限制下未剪辑第一视角视频的视觉语言描述生成
- 多语言大语言模型裁判中的排名反转现象:一种无标签的双中心化校准器
- SANE:面向稳定极长上下文 Delta 规则模型的状态异常中和技术
- 使用变分推断联合发现因果结构与聚类
- 为什么鲁棒性会减少叠加?
- 稀缺验证性PET测量的合理分配:A4/LEARN中的目标对齐验证
- Clinical Graph-JEPA:用于认知决策支持的预测性患者状态知识图谱
- DiaRelay:利用恒定大小内存进行对话情感识别的对话上下文传递机制
- 不要重复自己:在采样阶段制止逐字循环
- XTC:通过排除首选实现对头感知采样
- BLADE:大语言模型遗忘的双层低秩增广拉格朗日擦除方法
- 掩码并非模型:对注意力、状态空间及混合序列模型中前缀不变性的审计
- 用于视觉表征学习的双曲层次聚类
- KONTOGRAPH:在 200 毫秒决策预算下实现实时反洗钱的验证点时间特征一致性与摊销解释
- 从非侵入式脑电记录中解码感知语音的跨受试者泛化能力
- 面向黑盒大模型分类推理的层级感知监督不确定性估计
- 遗忘不等于简单擦除:基于生成不等式的时序解耦
- TRACE:面向一致且具备边界意识的大模型智能体的自进化技能库
- 超越裁决:基于图结构的科学事实核查中人类与大语言模型推理过程分析
- 粗粒度索引,细粒度证据:长视频RAG中时间粒度的解耦
- SplitLite:用于拆分学习的低秩残差压缩技术
- Pointing-VLA:面向视觉-语言-动作操作的类型化空间基础接口
- 英语-普纳语统计机器翻译系统:实证研究的若干见解
- PolyChirp:基于低功耗声学传感器与 TinyML 的多物种鸟鸣分类技术
- BenthicDINO:面向视角不变侧扫声呐表征的物理融合自蒸馏方法
- 用于实时托卡马克平衡预测的AI代理模型:神经网络架构基准测试与EXL-50U验证
- Sigmoid Attention:构建学习型 KV 缓存淘汰的更优底层架构
- LoRA微调过程中公理化注意力模式带来的相关性涌现
- Muon优化器的物理响应与记忆模型
- 正则化在平均化后能保留多少?联邦学习中的更新掩码机制
- 面向高弹性空间机器人的无奖励持续自适应
- DF-MoE:基于多模态稀疏混合专家的通用深度伪造检测
- 增值税判定中的大模型智能体任务拆解规模优化:一项试点对照实验
- InjecMEM:针对大模型智能体记忆系统的内存注入攻击
- 当名称跨越文字:蒙古世界历史实体对齐的源头依据基准
- 有什么玄机?评估视觉-语言模型中的时间一致性
- 带着意图行动:为视觉-语言-动作模型蒸馏行为意图
- 如何稳定且高效地训练评判模型(Critic)
- 基于记忆增强的神经求解器用于路径优化问题
- FIDES:大模型生成交易策略的一致性协议
- ConvergeFlow:具备可证明收敛到词元嵌入能力的语言流模型
- 知识图谱上的神经符号推理:基于查询视角的全景综述
- MACD:面向大语言模型的自学习知识多智能体临床诊断框架
- 超越基准:基于拟人化与生命周期导向的大模型评估路线图
- 前沿人工智能训练的零知识验证是可行的
- 检索对齐的表格基础模型:在真实世界约束下实现电子健康记录的稳健临床风险预测
- MOSAIC:面向结构化智能体与组合的模块化编排框架
- 巩固世界的边缘:多智能体世界边界中的持续学习问题
- 任务特定大语言模型蒸馏的缩放定律
- 关系型结构因果模型
- 自进化科学智能体发现可泛化的具物理推理能力流体控制策略
- 能缩小到什么程度?使用 LoRA 对 270M-8B 模型进行金融交易商户信息提取微调
- 面向可分叉计算的证据感知 MapReduce
- CMI-Mem:通过CMI增强强化学习实现具备泛化能力的长期记忆管理
- CacheSpec:在大语言模型中为小模型寻找最佳平衡点
- NL2SHACL-Bench:自然语言转SHACL翻译的基准测试套件
- 视觉语言模型中基于方向的推理时防御机制的跨架构审计
- Nova:面向深度学习的端到端 MLIR 编译器
- 推理捷径与价值对称性:对称性所允许的、架构所实现的与优化所选择的
- 基于分层语言模型的动态多字节预测
- 当熵不再足够:在大语言模型输出长度预测中找回丢失的语义
- InfraBench:跨层级、全生命周期与风险维度的基础设施智能体评估基准
- 医疗大语言模型因果知识图谱接地框架:心血管领域试点研究
- 服务掩码扩散大语言模型:来自真实硬件的特征分析与设计原则
- 测出的AI偏好中,模型占几何,测量工具又占几何?
- 审视合成回忆录:对照真实生活记录评估大模型生成自传中的场景级胡言乱语
- 门控激活引导:减少医学问答中的谄媚现象与幻觉
- AgentRoom:基于CRDT共享工作空间的并发多智能体编程
- Minima-KV:采用混合格式分页注意力的保持保留型 KV 缓存压缩技术
- 开放世界多智能体环境中的自主数学发现
- 语义叠加:超越Token与控制向量的提示词注入防御技术
- 数据混合作为混合实验:大语言模型预训练的响应面方法与最优设计
- 多智能体金融顾问中的检索增强生成与确定性税务计算:一项 2x2 析因实验
- 基于血缘引导的演化概念定义下的增量学习
- MARS:面向竞技编程的多专家大模型接力系统
- 更多 GPU 还是更小的缓存?大语言模型推理中张量并行与 KV 压缩的内存受限服务博弈
- 大规模语言模型中通过偏好数据筛选减轻对齐税
- 使用经过验证的任务覆盖率评估大语言模型的多次生成能力
- 基于约束引导的大语言模型企业数据映射
- MetaRAG:面向智能体RAG的信念-动作对齐策略优化
- 全能裁判还是全能偏见?通过平衡解耦视角诊断多模态裁判模型
- 算法影响揭示对齐中隐藏的社会选择结构
- 压缩三位一体:探索大语言模型压缩的稀疏性、量化与低秩近似
- 面向GUI奖励建模的任务自适应评分标准
- 选择性再生解码:面向推理时推理的轨迹级干预
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越正则化方法
- SonarLLM:用于水下感知的原生声呐-光学多模态大语言模型
- SA-Bench:评估基于大语言模型的论文复现中的语义对齐
- 从状态到行动:用于可靠多轮工具调用的 OODA-Tool
- 食谱也有人格吗?属性化程序图中的创作者风格表征与生成
- 交接税:LLM 智能体中延续非原生轨迹的代价
- 强化学习引导的演化策略优化用于偏好可调的异构敏捷对地观测卫星调度
- 裁判应当知道发生了什么变化:大模型作为裁判评估的构念效度
- EviDx:基于脚手架大模型智能体的证据感知主动诊断框架
- 大语言模型智能体的工具创建与使用联合优化
- 行动时刻的自信:隐藏信息下大语言模型博弈中的信念校准失误
- Meta\(^n\):通过涌现深度实现递归自我提升
- Parason:揭示大语言模型推理中的子任务与试验并行性
- 轴心与站点多智能体路径规划:可解性、复杂性与算法
- 直接语料库交互中的证据盲区:使用 AtlasNav 进行持久导航
- 大规模测评中自动化题目偶然内容相似度分析的双维度大模型框架
- RACE:大语言模型神经元功能一致的可扩展统计估计
- 正确的诊断,装饰性的推理:医疗思维链的扰动审计
- CAFE:自我提升的搜索智能体需要共同进化的反馈
- 保真度偏好,而非人口统计学偏好:图像美学/偏好评分器的像素级属性敏感度审计
- FedV-KGQA:基于垂直划分知识图谱的多跳问答框架
- 超越可执行模型:用于物理系统建模的 Pufibara 智能体框架与 Modelica 智能体工作流基准
- TrustShiftProbe:MCP服务器分阶段信任攻击的特征分析、基准测试与防御
- 通过几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性
- 放置、切片与调度:系留毫米波无人机基站的分层 O-RAN 控制
- 适得其反的反馈:为什么小型语言模型智能体总是重复刚目睹失败的函数调用
- 高效评分:面向低成本大模型作文评分的强盗算法驱动提示词选择框架
- 自信且错,悄无声息:端侧部署语言模型未遂故障审计
- 通过CT阅片过程中的3D注视模式预测放射科医生的专业水平
- 利用神经算子学习 Kohn-Sham 映射以实现准线性标度的密度泛函理论
- 超越授权指令:代理支付协议(AP2)的系统性安全分析
- 智能体何时应当停止?面向工具使用型大语言模型的证据携带式终止机制
- LUCAID:用于肺癌精准病理学的智能体多模态人工智能
- 完美拟合与虚幻最优:数据驱动模型如何在实时优化中失效
- 解释的数学理论:理性熵、谱读出与作为资源的混淆性
- 名字也能伤人:定位本地编码大语言模型中因包名幻觉引发的投毒抢注风险
- 冠状病毒优化算法 (COA)
- 企业级MCP网关的混合语义工具发现:架构与实现
- 面向测量诱导信息丢失场景的量子传感量子机器学习(QML)研究
- 智能的影子价格:作为供应链问题的大模型推理质量降级
- 云模拟器的自动化综合
- 分久必合:三大 LLM Agent 框架的架构趋同
- ORBITALIF:一种用于星载去云的高效脉冲联邦学习框架
- 大模型引导的工业过程操作决策上下文动作评估
- Design-to-Plan:基于大语言模型的多元智能体框架,实现从3D CAD模型与2D工程图到制造工艺规划的自动化
- PARTAB:基于结构化证据和分区感知推理的可扩展表格理解
- 知道何时寻求帮助:分层LLM智能体中的贝叶斯自我升级
- 面向条件式CMR合成的生成式基础模型元数据感知适应
- 关注学生:在线学习中用于自动化参与度预测的行为与上下文线索
- FARCA:面向具有事实监督的强化学习的事实对齐可靠性感知信用分配
- 对比分支策略优化 (CBPO)
- 分层结构因果模型的的可扩展与通用识别:重新审视 STAR 项目
- 等变协方差张量:张量值几何学习中具有SPD保证的不确定性
- 监督式不确定性量化集成何时能提升大模型幻觉检测能力?一项鲁棒性研究
- 从梯度提升树到深度推荐器:生产环境客服推荐系统迁移的实战经验
- Simthesizer:面向大模型推理服务系统的智能体驱动仿真框架
- 面向人类与机器代理的文学化编程环境
- COCI:会议组织者与内容标识符
- StrokeGuard:用于院前卒中评估的多智能体引导系统
- RAT:用于RAG评估的统一贝叶斯模型
- 基于可验证奖励的同策略蒸馏 (OPDVR)
- FraudBench:金融风险评估中对抗鲁棒性的协议敏感型基准测试
- Maia 200:面向大规模AI加速的软件定义数据流系统
- 住房潜力通用数据模型与城市数字孪生
- 模型发现智能体:大模型辅助的贝叶斯实验设计,实现数据高效的机理性世界模型发现
- ReflCtrl:通过表征工程高效控制大语言模型反思
- PHMForge:通过基于 MCP 原生、算法扎根的工具评估大模型智能体在工业预测与健康管理(PHM)中的表现
- ExPhy:多物体轨迹预测中显式物理属性学习的基准测试
- Quasar:专为大模型代码操作而设计的编程语言
- 单调且可分离的集合函数:特征刻画与神经模型
- SuperLocalMemory 4.0:面向AI智能体的受管控内存操作系统
- 基于强化学习的欧拉式车头时距控制缓解高速公路拥堵
- 眼见为实还是先入为主:评估开源多模态大语言模型在反直觉场景中的语言偏见
- 极简决策动力学与上下文概率:量子拔河模型
- EEG基础模型的测试时适应:现实世界分布偏移下的系统性研究
- ST-Lite:面向长程 GUI 智能体的免训练空间轨迹引导 KV Cache 压缩框架
- 迈向预测性流程挖掘的可复现性:SPICE —— 一个深度学习库
- ADVERSA:衡量大语言模型中多轮护栏退化与判别器可靠性
- 大语言模型还能解释自己吗?量化对自解释影响的研究
- 单个神经元何时能修复大语言模型中的重复循环?
- 通过算法与超参数的SHAP分析增强机器人强化学习的泛化能力
- Tournament-GRPO:面向开放式长文本生成强化学习的组内锦标赛奖励机制
- 超级智能检索代理:Agentic 检索的下一个前沿
- 是一个电路,而非那个电路:Mamba-2 状态汇聚的非唯一因果定位
- 离散扩散模型:从分词到生成的统一框架
- Eluna:用于自动化仓库运营的推理与任务执行智能体系统
- GraphVid:交互式图可控视频生成
- SaliMory:为对话智能体构建认知记忆系统
- MOSAIC:安全 AI 计算的掩码外包方案
- 从语料库到协同进化能力:面向通用图像生成的以能力为中心的数据设计
- 基于预训练特征、数据增强与全新 SheetSage-A2S 数据集的音频转乐谱系统
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量级无人机导航潜能
- 无真实标签的信用分配:基于执行重放对大模型智能体步级信用分配进行审计
- SANE:稳定极端上下文Delta规则模型的状态异常中和技术
- 训练知识库:面向智能体策展文档库的监督式结构学习
- MediSkill-Evo:基于过程约束的自进化技术实现有据可查的临床交互
- ER-KANs:面向数据稀缺科学机器学习的高效且鲁棒的柯尔莫哥洛夫-阿诺德网络
- LOCKS:用于高效长文本解码的页局紧凑键摘要
- 陷阱何在?评估视觉-语言模型的时间一致性
- 掩码并非模型:审查注意力机制、状态空间及混合序列模型中的前缀不变性
- 自进化科学智能体设计具备物理推理能力的白盒流体控制
- 最佳实践评判器优化 (BPCO)
- 分子大模型智能体:从架构设计到科学自主
- 从信息流视角看可解释性需求:规范与验证
- 罗马诺夫三元组逻辑的形式化验证:用于滑动窗口3-CNF的经验证过滤器及其在结构化公式中的应用
- 不可见的编辑层:形式化定义已部署语言模型中未披露的推理时操控、概率布局与归因难题
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越者正则化
- 自信地出错且悄无声息:对已部署端侧语言模型不可检测故障的审计
- pro-team 在 LLMs4OL 2026 的表现:用于本体学习的检索增强生成与词汇约束过滤
- 解耦规划与控制:面向可指令智能体的 Instruct-to-Act 系统
- 更智能的验证,更深度的进化:通过行为感知验证实现高效的智能体框架演进
- DSA:面向多市场股票研究的证据感知型大模型智能体编排框架
- 朴素提示词优化:重新审视复杂提示词搜索的必要性
- 位置即全部:基于MLLM指代表达式分割的免费午餐式Token压缩策略
- WikiSkill:将智能体经验编译为持久化知识以实现技能进化
- 并非所有评测觉察都千篇一律:能力框架可预测合规性
- 多语言仇恨言论检测的训练期可解释性:将模型推理与人类理由对齐
- 利用 Poly-Encoders 实现计算高效的自动化创造力评估
- GAMMA:任意预算下混合精度模型的全局比特分配
- 频率至关重要:用于剪枝与量化的快速模型无关数据筛选方法
- MIMO:通过单语目标实现多语言信息检索
- 放手让他们窃取:使用知识蜜罐拦截大语言模型提取攻击
- ATLAS:在一小时内自动化近似 Transformer 以实现高效同态推理
- 漂移自适应的ICU干预预测:冻结生理特征编码器以实现可审计的模型更新
- 12个CNOT的双量子比特激发门
- X\(^2\)Localizer:用于渐进式跨视角视频地理定位的跨粒度对齐方法
- 在仿真中预训练视觉灵巧操作
- 大规模供应链运营中可靠的大模型驱动决策引擎:架构、安全与性能保证
- 使用编码智能体进行自动研究:古兰经诵读数据上的泛化者与指标最大化者
- 潜在通信何时真正发挥作用?多智能体大模型中中继KV缓存的因果审计
- 具有有限次采样泛化保证的量子学习测量预算分配
- TriShieldRAG:检索增强生成分层防御中的三层护盾与盲区
- 通过部分可观测随机博弈求解带有Omega正则目标的鲁棒POMDP
- post-graph-rag:原生于 PostgreSQL 的图 RAG 引擎
- 自然语言输入、语义航迹表示与大模型推理:让海事信息交换模型变得可行
- SimVerity:模拟智能体成功何时能在物理部署中转化为现实?
- SIMGUIDE:基于程序化落地的多上下文表示法,赋能个性化智能体规划
- FuzzingBrain-Bench V1:评估大语言模型的开放式漏洞发现能力
- 联邦化几乎免费,推理则不然:蛋白质表征工作流中 AI 联合科学家的权衡
- PhysElite:大语言模型距离解决奥林匹克级物理题还有多远?
- 自动策略,而非自动技能:物理世界的编译型智能体技能
- 大语言模型创造力自动评估的局限性
- PhaseShift:信号交叉口之间的拓扑感知数据对齐与模型整合
- 面向早期前原理图嵌入式系统设计的LLM驱动及数据手册感知自动化硬件兼容性验证
- 基于游戏轨迹的账号一致性:《反恐精英2》中的同名玩家验证
- 你的AI Agent能更省钱吗?探究任务规范对智能体编程任务中Token消耗的影响
- FLARE:利用基于大语言模型的定理证明验证混合整数线性规划重构
- 位置与内容:解构大模型结构化输出中的结构与内容错误
- 使用大语言模型发现数据湖中的数据关系:一项工业级案例研究
- 不可靠建议下的学习增强型在线分配:鲁棒性、曝光公平性与分布偏移
- DEEPCHART:大语言模型距离实现忠实的数据科学图表生成还有多远?
- C-Unseen:利用大模型推理检测动态时序知识图谱中的弱信号
- AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索
- 折扣和收益的分类自动机
- 概念复杂的范围综述中人工与大语言模型筛选工作流评估:召回率-工作量权衡与运行一致性
- 一张表格价值64个Token:多表格文档问答的像素级压缩
- ASIL:用结构化状态与语义动作取代截图点击式交互
- 更聪明的验证,更进一步的演进:通过行为感知验证实现高效的 Harness 演进
- pro-team 参加 LLMs4OL 2026:基于检索增强生成与词汇受限过滤 本体学习方法
- GraphMemix:面向长期多模态智能体内存的查询感知证据森林
- 并非所有的评估感知都生而平等:能力框架预示着合规性
- 解耦可指令智能体的规划与控制
- 朴素提示词优化:重新审视对复杂提示词搜索的需求
- DSA:面向多市场股票研究的证据感知大模型智能体编排框架
- 位置即全部:基于多模态大语言模型的指代表达式分割免训练Token压缩策略
- WikiSkill:将智能体经验编译为持久化知识以实现技能演进
- 句法与语义:Transformer如何学习深层依赖
- 使用多重编码器实现计算高效的自动化创造力评估
- 迷失于压缩:提取式提示词压缩器跨语言受控审计
- 当规范补全出错时:大语言模型中“跳跃”的形式化与度量
- 土耳其语RAG系统中分块与嵌入策略的对比研究
- 大语言模型长文本生成中大纲阶段的多框架对比研究
- 用于编排异构语音和文本检索器的重排器
- DRL:面向模式图扩展的事务安全企业级 NL2SQL 确定性关系中间件层
- 基于图结构电子占据离散流匹配的机理反应预测
- 关于作用域分类与当前知识编辑基准的负面结果:以INLAY作为无梯度案例研究
- 公平性不变式:解释与缓解公平性缺陷的关系方法
- Redwood:由AI在两周内从零设计、验证并部署的前沿AI加速器
- 为什么RAG会产生幻觉:引入“知识缺口金丝雀”的检索增强生成系统惩罚感知评估
- SpeechGym:用于通过强化学习训练语音智能体的音频原生训练环境
- CG4AI:一种用于约束条件下训练 AI 模型的列生成框架
- 潜诊断分类法:构建分类器及诊断其决策的框架及其在提示词注入检测中的应用
- Diff Mining:通过Logit差异揭示微调目标
- 物理信息随机配置机:一种用于非线性微分方程的无反向传播快速训练神经网络
- Behavior2Trip:基于用户行为轨迹迈向个性化旅行规划
- 将文本属性图学习中的消息传递重新构想为检索
- 超越执行:审计大模型驱动的科学研究中的实验保真度
- 安全性无法组合:自主LLM智能体的非衰减循环状态
- 用于基于事件的神经形态目标分类的 ANTShapes 基准数据集
- 并行与分布式推理语言模型的性能基础
- “不太可能”究竟有多不可能?评估大语言模型对概率词汇的感知
- CoGeo-GS:3D场景中基于概念驱动与几何感知的多物体擦除
- 在截断评分量表上使用双重差分法会制造出虚假效应:来自一项预注册大模型裁判审计的证据
- PailitaoGR:生成式图像检索的潜在图像思考框架
- 语言模型如何组织与构建道德知识
- PACE:用于快速 VLM 推理的统一压缩与提取范式
- 数字EDA中的大语言模型:从生成到编排的角色转变视角
- 角色与执行分离:在执行审计下演进LLM智能体的架构模式
- LeVJEPA:摆脱启发式规则的高效且可扩展的视频预训练
- CLAP:跨具身视频世界模型作为零样本物理模拟器
- 使用超低比特量化模型拓展大语言模型推理的极限
- DeepPlanner:通过优势塑造扩展深度研究智能体的规划能力
- SWE-Prime:更少的轨迹,更优的性能
- 超越 F1 分数:评估 AI 模型安全扫描器的覆盖率与故障恢复能力
- RedEvoAgent:基于经验驱动技能演化的自动化红队测试智能体
- 语言模型会遵循奥卡姆剃刀原理吗?归纳与溯因推理中的简约性评估
- 在高维事件序列中学习预测、发现与推理
- 大模型驱动的群集智能:新前沿还是概念延伸?
- FlavourBench:用于大语言模型评估与后训练的可执行烹饪奖励地图
- 图像分类神经网络中,权重高的神经元一定重要吗?
- 编码智能体是否需要可执行世界模型、简化和验证来解决 ARC-AGI-3?
- ProvenanceGuard:基于模型上下文协议(MCP)的大模型智能体源感知事实核查机制
- ExecRubrics:用于可验证且高效长文本评估的可执行工具增强评分准则
- 基于错误代码驱动的测试用例合成与密集奖励塑造的稳健代码强化学习
- 从惯性走向客观:通过噪声隔离提升深度研究智能体的性能
- 超越端点收益:医疗专业化模型的权重差分审计
- HybridProver:通过大模型驱动的证明合成与精炼增强定理证明
- Egosurg:利用环境摄像机进行手术室工作流第一人称回放的任意视角合成
- CollaFuse:协作式扩散模型
- NiyamAI:基于零知识证明的具备密码学可验证护栏的意图绑定型AI智能体
- 扩散模型原理
- CounterVid:用于缓解视频-语言模型中动作与时间幻觉的反事实视频生成
- 残差奖励模型:利用先验知识实现机器人领域高效基于偏好的强化学习
- AirLLM:基于扩散策略的自适应 LoRA,用于大语言模型的无线远程微调
- “无瑕”之心铭记什么:知识纠缠如何塑造大模型遗忘后的信息泄露
- LoRA 作为预言机:基于低秩适配器的神经网络隐蔽后门审计与消除
- 频率至关重要:用于剪枝与量化的快速模型无关数据筛选
- GAMMA:面向任意预算的混合精度模型全局位分配框架
- 放任盗取:利用知识蜜罐诱捕大语言模型提取攻击
- 漂移自适应ICU干预预测:冻结生理编码器以实现可审计的模型更新
- TriShieldRAG:检索增强生成分层防御中的三重防护网与一个盲点
- 隐式通信何时真正奏效?多智能体大模型中中继KV缓存的因果审计
- 大规模供应链运营中可靠的LLM驱动决策引擎:架构、安全性与性能保证
- 在仿真中进行灵巧手操作的预训练
- X\(^2\)Localizer:用于渐进式跨视角视频地理定位的跨粒度对齐框架
- 使用编码智能体进行自动研究:古兰经朗读数据上的泛化者与指标最大化者
- SIMGUIDE:基于程序化落地的多上下文表示,赋能个性化智能体规划
- 基于游戏轨迹的账号一致性:反恐精英2中的同玩家验证
- 通过部分可观测随机博弈求解具有 Omega-正则目标的鲁棒 POMDP
- SimVerity:模拟智能体成功何时能在物理部署中持续?
- PhysElite:大模型距离解决奥赛级物理题还有多远?
- 联邦几乎零成本,推理则不然:蛋白质表征工作流中AI联合科学家的权衡
- FLARE:利用基于大语言模型的定理证明验证 MILP 重构
- PhaseShift:信号交叉口之间的拓扑感知数据同构化与模型整合
- 面向嵌入式系统早期原理图设计阶段的LLM驱动、数据表感知型自动化硬件兼容性验证
- 你的AI Agent能更省钱吗?探究任务规范对智能体编码任务中Token消耗的影响
- 自然语言输入、语义轨迹表示与大模型推理:让海事信息交换模型变得易于实现
- GLM-5.3-Flash 对比 Qwen3.8-Flash-Next:两家中国 AI 实验室如何独立收敛于相同的模型架构
- LongGuard:安全护栏长文本失效的机理分析与免训练缓解方案
- WM-R1:通过强化学习训练具备推理与世界模型利用能力的GUI智能体
- 大模型增强的因果发现:边存在性与方向性的概率融合
- 基于类别的启发式选择算法求解飞行积木拼图
- 评判评判者:将拉施测量理论引入大模型评估
- 看见、假设与验证:用于发现控制偏微分方程的多模态智能体框架
- RealSWE:真实用户请求下编码智能体的组合式评估
- SABER:基于对抗分支探测的大语言模型推理稳定性感知早退机制
- 思考消耗Token:何时更复杂的结构才物有所值
- GOD:治理、观察与指挥 —— 智能体社会的实时控制室
- String:一个让每个应用皆为 Markdown 文件的智能体操作系统
- CrabOS:人机共栖操作系统
- 保持在边界内:基于距离引导解码的保证上下文无关文法合规性
- 从文档到推理:面向金融数值推理的验证型合成数据流水线与语义感知微调
- 面向忆阻器的哈amard水库计算:规模化、结构化且无乘法器的递归结构
- 投机探测:以投机解码成本实现大模型监控
- 面向超大规模电商的时效感知复购预测:多界面生鲜推荐的生存分析模型
- REINS:基于稀疏自编码器特征的拒绝增强抑制性调控
- 带可验证奖励的程序学习:大模型后训练的符号反向传播
- 物理引导的流匹配用于CT图像重建
- VERA-8B:基于SEC备案文件的证据溯源审计风险推理模型
- 学习使用工具:用于工具集成数学推理的强化学习
- PACE:基于智能体自动化的发布者自适应内容提取
- 选择而非训练:基于大模型选择器的模块化实体消歧的优势
- 大语言模型中的量化触发式后门:跨量化器可迁移性与验证-部署鸿沟
- 基于边缘端YOLO与RT-DETR的深度感知路面坑洼检测
- 先实现可玩,再追求优秀:面向小型对话游戏智能体的分阶段交互学习方法
- 答前先知:解码语言模型以实现可靠的RAG
- ContextLeak:通过恶意工具窃取大模型智能体上下文
- 基于曲率感知半径收缩的自适应最近邻分类
- OpenStamp:面向开源语言模型的水印技术
- 超越搜索模仿:免搜索国际象棋的先验导向探索
- 生物学中AI模型的高效自动可解释性
- 可操作的CBFI:将结构分解与因果反事实追索集成用于表格机器学习
- VICT:面向长视距大模型智能体强化学习的验证器注入信用追溯
- 条件流匹配何时可以替代逐点负对数似然?
- 嵌套字节级词表部署成本低但共享代价高:一项预注册的否定性结果
- 相比于谁?大语言模型生成基础设施即代码(IaC)的人类锚定安全基准
- 超越扁平网表:用于时序电路可扩展分析的分层图表示学习
- Softmax 注意力的近似秩:尖锐的几何规律与鲁棒的交互维度
- 大型视觉语言模型中用于缓解幻觉的动态对齐补偿方法
- PanelShield:面向机器人工业面板操作的可验证闭环安全规划
- KV缓存淘汰的概率解释
- 推导 OpenEuroLLM 模型的缩放定律:学习率、批大小与损失
- 分层大模型防御作为集成体系:访问层级、推理成本与防御层之间经测量的失效相关性
- 保真度远远不够:面向智能体数据表提取的调度级插桩技术
- 神经算子的保角不确定性量化保证
- 智能体插件的维护与共演化:Claude Code 插件市场的实证研究
- ARC-CT:面向3D胸部CT的解剖路径对比视觉语言学习
- Agentao:面向嵌入式工具使用大模型智能体的策略治理运行时框架
- 无证据提示:神经影像提及如何改变临床视觉-语言模型的预测
- 注意力作为条件反射:经典学习理论对线性Transformer的预测
- 语义叠加层:超越词元与引导向量的提示词注入防御新范式
- 基于图结构电子占据离散流匹配的机理反应预测
- 超越置信度:通过检索扎根实现多信任搜索智能体的测试时扩展
- 安全性的不稳定性:随机种子与温度如何暴露出大模型不一致的拒绝行为
- Think-at-Hard:用于提升推理能力的动态循环 Transformer
- 自主性税:防御训练破坏了 LLM 智能体
- PRISM:基于大语言模型的智能体检索多跳问答系统
- CoFrGeNet:面向语言生成的连分数架构
- OmniFusion:基于模块化融合的端到端多语言多模态同步翻译
- 为什么所有大语言模型都对日本文化“情有独钟”?解析大模型中隐藏的文化与地域偏见
- LongDS-Bench:长周期智能体数据分析失败机制研究
- 语言模型评分细则引导强化学习综述
- 更具表达力的前馈层:第一部分. 激活函数的Token自适应混合
- 离散对数时钟:Transformer 如何学习模乘法
- 锁定的评估表面:CRISPRi 扰动效应预测中的迁移失败与采样深度纠缠
- 激活引导的信号来源:激活引导中的激活源选择
- 微小体量,巨大影响:大型语言模型中的缩放向量研究
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- 逻辑门网络的深度可扩展性研究
- 土耳其语 RAG 系统分块与嵌入策略的对比研究
- SpecMine:大规模规范驱动开发(SDD)工件语料库
- Redwood:由AI从零开始设计、验证并在2周内部署的前沿AI加速器
- Var-JEPA:联合嵌入预测架构的变分公式——弥合预测式与生成式自监督学习
- LongGuard:安全护栏长上下文失效的机理分析与免训练缓解策略
- Logos:基于跨进程总线的智能体运行框架
- 不为破坏,而为证明:用于保护隐私的大模型验证之对抗性探针
- FastSLM:用于高效长语音自适应的分层时间抽象架构
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 面向超大规模电商的时序感知复购预测:多场景生鲜推荐的生存分析模型
- 推导 OpenEuroLLM 模型的缩放定律:学习率、批大小与损失
- 跨回合智能体记忆的失效契约
- 自发欺骗与受指令欺骗中的不对称性
- EULER:利用经证据校验的回传机制探索多智能体数学发现中的未充分利用链接
- 大语言模型中的长视界状态追踪:通过深度依赖工具调用链执行MD5
- mimeo:将公开专家文集编译为智能体技能并测试知识迁移
- ISO-RAG:用于检索增强生成等周噪声控制方法
- 摆脱冗余推理:面向推理阶段大语言模型的结构感知搜索
- 市场目录的自动研究:从传统表单到AI原生匹配
- 基于输出重要性的残差稀疏化:用于压缩专家混合大语言模型
- 苏格拉底遭遇“核”聚变:利用脑电波传感技术对比学习场景下AI系统的交互策略
- 压缩驾驶策略中能力损失与恢复的闭环评估
- 一种策略,适应任意预算:通过强化学习内化预算感知搜索
- SOVER:通过大模型辅助的SMT验证实现优化问题重构的形式化认证
- 强化学习增强的大语言模型智能体求解复杂车辆路径问题
- 精修却未决:识别长程工具使用智能体中的后期压力状态
- CacheBridge:高效的跨模型 KV 缓存传输
- 自由派生,审慎行动:递归大模型智能体树的渐进风险归属机制
- 当特征成为样本:用于无监督特征选择的倒置对比学习
- 解析流式数据:面向长程智能体及其观察者的实时追踪模型
- Harness-of-Harness:实现具备持续改进能力的多天自主软件开发
- Analog-DB:面向Agent的模拟集成电路数据库,从模块到系统
- 潜在循环思考:基于冻结大语言模型的连续隐空间循环精炼推理
- AutoXRD:用于粉末衍射分析的自主大模型智能体与综合评测
- trajectory-judge:仅看结果的 LLM 评判器在评估智能体轨迹时遗漏了什么
- 当护栏看似有效时:LLM智能体商业评估中的构念效度失效
- 从检测到拒绝:通过电路引导的权重缩放构建更安全的大语言模型
- 廉价验证器与巨大的盲区:衡量降本级联的可靠性代价
- 检索、打分与解码方式对基于大语言模型的对话式推荐系统性能与稳定性的影响
- OCGQuant:面向 NVFP4 量化的异常值伴随分组法
- 比 Flash 更快:利用注意力稀疏性实现高效的长文本解码
- QTEA:基于稀疏残差显著权重与按列优化的三值大语言模型
- 连接一维集体行为自发与场诱导机制的人机定理
- 生成式模型隐空间中隐含波动率曲面的无套利几何学
- WHALE:联合优化框架与模型权重的简单方法
- 智能边缘计算
- WiSDoM:面向多任务移动网络优化的基于混合专家模型的无线稀疏决策Transformer
- 不要让模型直接写 YAML:基于大模型字段变更的确定性、最小差异 GitOps 修复方案
- 通过激活匹配微调检测大语言模型中的隐藏行为
- (V)LMs 超越表面共现泛化能力的实证研究:来自跨模态数一致性的证据
- 无梯度自适应:仿射统计迁移及其证书的启示
- 能力门控语言模型:安全性具备组合性,而效用则不然
- 超越Token位置:扩散语言模型中跨去噪步骤的安全对齐
- 非凸优化中的运行机制:基于乘子的分类法
- 运行时独立的持久化智能体:跨模型、框架与服务器保持身份、记忆和代码的连续性
- 使用大语言模型与编程语言语义预测程序退出代码
- 坦白你所知:大语言模型遗忘中“遗忘集与模型知识错位”问题研究
- 听见却未听取:音频-语言模型中的副语言信息编码与丢失
- 预测编码网络中隐藏状态优化顺序的研究
- MADS:超越标准频谱汇总的多视角声学描述符集
- 智能体程序:计算材料科学中一种新兴的科学软件形态
- 通用语假设:大语言模型通过潜在的、与任务无关的特征空间进行翻译
- 用记忆替代训练:Text-to-SQL 的列表式选择方法
- 上下文对齐增益由预存在机制介导:GRPO、SFT与DPO的审计分析
- ViTAMINS:利用合成难负样本训练自监督视觉Transformer的实证研究
- 从截断到承诺:均匀离散扩散模型中的持久上下文
- TimeSteer:联合视听扩散模型中的推理时语音调度
- 滞后耦合:内部表示在具备因果效力之前就已经可读
- REFACTOR-VLA:类型化运动程序的无监督库学习
- 高维POMDP的可扩展Rao-Blackwellized在线规划
- 生产环境中的多臂老虎机:推理时超参数优化
- 位置至关重要:带有Token裁剪与重排的ViT分布式推理中的特征反演攻击
- 当安全路由失效:解析良性微调下的对齐脆弱性
- 通过 Transformer 变分自编码器学习稀疏决策树
- CordisBench:语言模型能否在动态智能体运行框架中进行组件生命周期推理?
- 多模态大语言模型内部视觉表征的因果探测
- 关系核心图分析:以SQL规模查询图数据,以及为什么节点/边模型是性能税而非连接数据的真实写照
- 基于大语言模型程序合成的组合式机械设计
- 基于扩散大语言模型的视觉语音识别
- 流式推理模型:将流模型转化为高效的循环推理器
- 保持统计严谨性的重要性:对 GSM-Symbolic 的批判性重新评估
- 针对基于Mamba语言模型的隐藏状态投毒攻击
- 人工实验者:利用自主目标强化学习发现与控制自组织现象
- 面向上下文密集型任务的 KV 缓存卸载技术
- 基于推理的汽车电气/电子组件鲁棒性验证
- 一个Token抵一千个:通过低 rank 克隆实现高效知识蒸馏
- 学会记忆:面向长文本推理的记忆智能体端到端训练
- 为什么微调会加剧幻觉以及如何解决
- 非线性算子及其导数的通用近似定理
- 表征干涉的驱动力是什么?关于干涉模型拒绝机制的机制性案例研究
- Transformer的拓扑困境
- 基于能量的 Transformer 作为阅读难度预测指标
- 为扩散语言模型启用共享前缀的 KV 缓存
- 智能体强化学习中的技能复用与压缩
- 揭示大语言模型中类人表征的计算要素
- 引导而非求解:为大型代码智能体训练小型评论员模型
- 照我说的做,别学我做的:大语言模型中的指令-归纳冲突
- 雅可比视角下的循环Transformer:全局工作空间能在循环中幸存吗?
- HeadWiseKV:混合长上下文语言模型的按头预算化缓存驻留机制
- Qwen3-4B 后训练三值化:能力、有效比特预算、存储压缩与部署
- SSAKG 2.0:用于结构化关联序列记忆与基于上下文检索的开源软件包
- 大语言模型中的“拆屋效应”请求与拒绝行为
- 结合知识图谱扩展、RRF融合与分块扎根评估的企业文档搜索混合检索增强生成技术
- 从特征交互到特征传输:可扩展推荐模型的统一构建模块
- 匹配器裁决:威胁报告知识图谱提取的可复现性审计
- 字典引导的变异算子:用于自动化 HDL 修复
- HEAT:通过近似与权重协同适配实现更快速的全同态推理
- RecKAN:具有可学习递归多项式基的柯尔莫哥洛夫-阿诺德网络
- 大模型作为裁判并非全知全能:为什么自我进化智能体需要确定性防护栏
- 在线蒸馏相遇离线GRPO:训练紧凑型指令遵循重排器
- 面向行业标准电网信息与交换模型问答的种子锚定预算受限图渲染
- OutageDiT:用于电力故障预测与场景模拟的生成式基础模型
- Zeta-Lite:面向智能体记忆的并发、可分支浏览器内 SQL 数据库
- 基于平均场代理模型的共享GPU上并发异构AI推理可扩展运行时调度
- 跨四个国际胸部X光队列的BiomedCLIP联邦LoRA自适应研究
- 伪装成对数的幂律:探究基于图的向量搜索的可扩展性
- GeoSPRINT:扩散轨迹推理中基于几何冗余感知的步数剪枝
- 可扩展的克罗内克-费雪近似:针对十亿参数语言模型压缩的高效黑塞矩阵分析
- 优化中的渗透动力学:方差级联与离散尺度不变性
- 使用大语言模型在智能合约中进行自动化漏洞注入
- DiffIE:基于扩散模型的开放式信息抽取
- 稀疏混合专家模型中共享路由几何结构与动态的证据
- TaRA:感知训练过程的低阶适应初始化方法
- 后训练语言模型在编程竞赛中实现金牌表现
- 历经二十年的 frb100-40:最优性证书与预注册搜索研究
- 联合嵌入预测世界模型在物理规划中取得成功的关键驱动因素是什么?
- 语言模型能够自主控制注意力
- DKL:面向指令微调语言模型的解耦知识学习方法
- AI 数学家:迈向完全自动化的前沿数学研究
- FormalEvolve:用于多样化自动形式化的神经符号演化搜索
- 衡量大语言模型中的推理质量:多维度行为框架
- 语言模型智能体能成为机械可解释性中得力的电路解释器吗?
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- LivingArena:大模型知道其他大模型不知道的吗?作为可扩展评估的同伴探测技术
- 面向海上监控中异构传感器选择的强化学习
- 评价评估者:将拉斯施测量理论引入大语言模型评估
- 视觉语言模型是在阅读还是在重写?探究视觉语言模型中的转写忠实度
- PIE-APT:通过增量推理在时序动态知识图谱上进行 abductive 规划
- 超越RAG:实时对话中的问题识别与答案生成
- Nova:面向深度学习的端到端 MLIR 编译器
- 基于大语言模型的自适应岛屿图演化自动特征工程
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- 多层状态空间模型(SSM)的表达能力与局限性
- Shiva-DiT:用于高效扩散 Transformer 的基于残差的可微分 Top-\(k\) 选择方法
- 语言扩散模型是能够检索未见数据的联想记忆
- Agent Tools Orchestration 泄露更多:数据集、基准测试与缓解策略
- 扩展用于单细胞生成的自回归Transformer模型
- 自监督视觉表示学习的三个必要原则
- 超越迁移准确率:面向低资源语言的机制引导受控自适应
- 训练 nGPT
- 为扩散语言模型启用共享前缀的 KV 缓存
- 给它空间!编码器中位置与语义表示的显式解耦
- 从大型语言模型中直接构建消歧知识库
- 生产环境中的多臂老虎机:推理时的超参数优化
- 每次都能完美掌控十七:企业数据分析的受控方法
- 用于加速工具使用型智能体的推测性宏指令提交(Speculative Macro Commit)
- 记忆常新,计划陈旧:分布式大模型智能体记忆的依赖域验证
- 通用型AI助教中构建可扩展、灵活且实时的混合微观个性化提示工程方法
- Dude:用于论文与代码差异检测的双重检测多智能体系统
- DuplexSpeechBench-IFEval:评估全双工语音智能体中的隐式指令遵循能力
- 多模态GUI智能体是否知道何时停止操作?实现具备冲突意识的终止机制
- 超越“AI生成”:通过可视化溯源密度来缓解透明度惩罚
- 我们该多大程度上信任开源数据?
- 陷于故事:多轮大语言模型对话中的叙事捕获现象
- GrowPage:用于高效大模型推理服务的按需 KV 预算管理
- 结合视觉先验的医学病灶分割特征重构方法
- AutoGraphForge:迈向图论的自动化发现
- 让每一次工具调用都发挥作用:智能体视觉语言模型的必要工具-证据路径奖励
- PPO-STGNN:结合时空图神经网络与近端策略优化的云边端计算DAG任务调度方法
- NeoRed:面向新生儿呼吸系统疾病诊断的知识-逻辑-对齐多模态大语言模型
- 药物毒性预测中提示词工程的分析研究
- 激进解码期 KV 淘汰的关键要素:时间聚合与排序保持
- Dalek:构建式智能体机器
- 物理实验室的可计算表示助力可验证工作流
- 音视频模型中的注意力三角形
- HalluPeer:用于检测科学同行评审中幻觉的分类法驱动基准
- 小型Transformer中用于对比代码表示学习的合成语义监督:一项实证研究
- KC-Bench:用于评估大模型智能体中知识冲突的动态交互式基准
- SimSkill:用于自主掌握交通模拟的终身学习AI智能体
- DNative-Twin:用于可重建智能体决策的决策图与数字孪生
- 重新审视面向安全关键具身系统的世界模型
- 语义贝叶斯世界模型
- SVG-Score:与人类偏好对齐的文本生成SVG评估方法
- Transfiver:通过共享可编辑状态实现人机协同推理
- 主动式服务智能体:统一的决策框架、方法与评估
- 使用约束生成整数规划的反事实路由
- 去除顺序,保留层级:HTN计划的反排序技术
- 适应不断演变的需求:用于零售供应链运营的智能体化 AI
- Bioinfoysis技术报告:面向长期生物信息学任务的持久化构件锚定多智能体系统
- 推断人工代理的情感意识:一个案例研究
- Xiaomi-TabLDM:表格基础模型技术报告
- CauseCollab:用于异构协同感知的因果统一与模态无关网络
- 智能体AI系统的价值保留架构
- 更多的批评并不等于更好的审稿:EquiReview-R
- 接口诱导的轨迹审查:AI智能体评测中的静默失效
- 替我发言:赋予大语言模型参与会议的情境感知能力
- STAIR (结构感知信息检索器):用于文档结构增强的新型数据集与大模型检索器
- 基于 SMT 的 HTN-SAT 编码实现数值型完全有序 HTN 规划
- 规划即推理的双平坦几何
- InSituMeasure:利用多模态大模型探究工业场景中的情境化测量基础
- 为什么门控DeltaNet能在4位量化下存活:混合27B大模型循环部分的NVFP4 W4A4技术解析
- FLY-EVAL++:面向大语言模型安全约束飞行预测的证据驱动评估协议
- GRPO中隐藏的虚假优势
- 指令复制作为推理时控制基元
- DRACO:基于动态评分标准的长期智能体训练细粒度信用分配
- 从欺骗性输出到欺骗性机制:语言模型欺骗研究的因果框架
- 通过人机交互实现高效测试时适应
- Terminal-Universe:将智能体轨迹转化为可扩展的终端环境
- 自主研究智能体群体中涌现作弊与吹哨行为的案例研究
- ExecRetrieval:衡量代码嵌入检索中的功能正确性差距
- 倾听潜变量:通过大音频语言模型中的隐状态交互实现自纠错语音识别
- 评估大模型裁判:大模型自动化文本生成评估中令人担忧的评分标准伪影
- 反例作为智能体自我修正的反馈
- Reflect-SQL:基于自我反思的 Text-to-SQL 框架
- PrivateHub:用于私密传感器密集型环境数据生成的对比扩散模型
- 当优化演变为操纵:防御针对生成式搜索的恶意生成引擎优化
- 清洁工程,不稳定测量:黑盒大语言模型观察者在共享端点上预注册的可靠性失效
- 基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全性
- ObserverBench:测试用于干预和控制的机械解释估计器
- 一种计算上可行的因果概率解释框架
- TabScope:面向表格问答的问题自适应范围选择
- StrixAE:面向真实场景复杂失真耦合的音频增强智能体
- 匿名化而非消除:保留实用性的语音匿名化
- 文明框架:个人多智能体系统间基于主权锚定的通信
- 是问题本身,而非路径:大模型推理轨迹中的预算与难度混淆
- SHELF:用于多任务书目基准测试的合成评估框架
- 蒸馏前先验证:面向在线蒸馏的提示级教师门控机制
- 多维空间中随机特征方法的谱收敛性
- 继承式智能体记忆预算验证中的计划指针与记录指令形式
- WIDE:用于跨模态生成式检索的动态扩展通配符推理
- LevelSyn:基于层异步图神经网络的物理感知逻辑综合
- 当用户不再主动提问:对话式智能体中上下文驱动记忆检索的基准评测
- TraveL:基于Transformer的多视角路径分布表示学习
</think>无法停止推理:虚假思维链终止现象分析- FailBench:视觉语言模型在判断机器人任务成功率方面有多可靠?
- 丹麦树种测绘:光谱时间特征与地理空间基础模型嵌入的对比
- GraFT:通过3D场景图实现多模态大语言模型空间推理的免训练框架
- 迈向面向目标条件化机器人规划的物理基础 JEPA 世界模型
- 表征对齐带来语言模型中具泛化能力的安全性
- 子空间推断助力基于偏好的高效主动奖励学习
- 当模型改动过多:论最小代码编辑的保真度
- 合成数据能将泰语 OCR 推向多远?
- 见证者解释异常:WAND——具备原生可解释性的无监督表格异常检测器
- 数值数据可解释异常检测的可微区间瓶颈
- 挤出长丝形状对3D混凝土打印可打印性的影响:基于几何信息的深度学习-有限元方法
- 顺序优于联合:探索策略内蒸馏与RLVR之间的相互作用
- 面向微型阿克曼车辆端到端自动驾驶的低成本开源平台
- 语法对齐解码:保证结构化生成的正确性与概率保真度
- RARF:用于三维脑部 MRI 修复的区域感知纠正流模型
- 通过训练编译:将自然语言规范转化为本地神经函数
- SWE-Gate:通过功能测试对软件工程智能体而言远远不够
- NeuroWeaver:用于探索脑电图分析管道程序化空间的自主进化智能体
- 多模态大语言模型内部视觉表示的因果探测
- 解码前拒绝:检测与利用大语言模型中间激活中的拒绝信号
- 审计多智能体大模型推理树:性能超越多数投票与LLM作为裁判
- 通过卢卡谢维奇逻辑完全识别深层ReLU网络
- CoMAP:用于大语言模型智能体的世界模型与智能体策略共同演化框架
- SENTINEL-RL:将拓扑推理从安全运营中心(SOC)的LLM智能体中剥离
- 学会选择而非重新学习:基于硬路由推理 LoRA 混合模型
- 超越编译:评估忠实的自然语言到 Lean 定理形式化
- LDC:通过动态控制生成研究构想的学习框架
- ScoreMix:利用扩散模型中的分数组合生成合成数据以提升识别性能
- LightEMMA:视觉语言模型自动驾驶能力的纵向评估
- K-Bench:衡量模型在真实科学智能体请求上的性能
- 迈向经济实惠的能源:用于电力公司需求响应项目的 Gymnasium 环境
- 人类心理测量问卷错误表征了大语言模型的行为
- Sionna RT:技术报告
- 在开源大语言模型中读取与调控材料科学机制的表征
- 大语言模型时代的医学推理:增强技术与应用系统的全面综述
- 关系线性度是大模型幻觉的预测指标
- 联邦学习中破坏模型置信度的温度缩放攻击
- F-GRPO:别让你的策略只学显而易见的常识,而遗忘那些稀缺的解
- HARP:用于极端大模型量化的哈 Hadamard 预处理自适应旋转处理器
- 超越可复现性:迈向面向安全意识的研究制品评估
- 结构化忠实:面向多文档摘要的声明锚定归因方法
- SV-Detect:利用引导向量进行AI生成文本检测
- 迁移安全意识:多模态大语言模型中的跨模态安全漂移
- 重复不匹配:为什么数据配比实验无法扩展以及如何解决它们
- 科学智能体技能:面向研究智能体的程序化知识库
- 问两次,看两次:提示词回显解决了视觉语言模型中的“问题前置悖论”
- 思维链失效时,解法隐藏在隐状态中
- 形式化验证费马大定理:Claude历时11天实现数学史里程碑
- MaxKernel:面向 TPU 的智能体内核生成
- PerfReasoning:大语言模型在硬件性能推理上的表现究竟如何?
- 将间接提示词注入重新构想为测试时搜索问题
- 当量化破坏记忆:低精度时间序列推理中的循环状态回写机制
- 多套具现强化学习学到了什么?编码智能体中的归因与可迁移性
- FinalityBench:评估智能体在延迟与冲突金融终局性下决策的效果级基准
- 面向嵌套企业级架构的成本感知自然语言转SQL智能体架构与全新基准测试
- 极度稀疏的监督信号即可激发大模型的推理能力
- SQL-Zero:自我进化的 Text-to-SQL
- IPGeoAI:基于Transformer与大语言模型语义融合的IP地理定位技术
- DODR:潜在空间中的确定性算子驱动推理
- 通过幻觉空间投影减少 Whisper 模型中的幻觉转录
- 当金融微调失效:领域适应大模型中数字幻觉的三级可检测性分析
- 面向多站点工业预测性维护的长程Transformer分位数故障预测
- CHAMP:在线多人游戏中用于配对与预测的跨域混合架构
- 从交互轨迹到持久化技能:计算机操作智能体的在线演化
- 通过论证分析衡量人工智能问责制:模型的推理经得起推敲吗?
- 大语言模型引导的圆堆积程序演化:花费 28 美元打破 10 项 Packomania 纪录
- 从语言模型到世界行动系统:智能体AI在数字、社交、虚拟与物理环境中的进展与局限
- AutoLR:实现工业级推荐系统中从研究到上线评审的自动化
- 具备底层感知能力的AI智能体:将执行上下文作为一等输入
- ACE:基于MoE的大语言模型自适应免校准专家跳过技术
- 别放弃Dropout:优化层稀疏性以实现高效的LLM训练与推理
- 你的智能体记忆能经受住模型升级的考验吗?记忆可移植性的对照研究
- 韩国开源公共API的多步工具调用:基准测试与数据合成配方
- 面向语音大模型服务的可扩展上下文编排
- 基于二元决策图的大模型驱动量子电路综合算法设计
- 大语言模型中的证据整合机制
- 面向成本感知导航的紧凑型贝尔曼扎根认知地图
- 基于潜空间探针的扩散式音乐生成音高类引导方法
- 负载均衡走向极端:过度离散混合专家模型中的专家剪枝专家洞察
- 通过贝叶斯视角统一 ICL、SFT 与 KL 正则化强化学习
- 大型语言模型中的文化不对齐:检测、度量与通过定向微调进行缓解
- 在细粒度混合专家模型中免训练将激活专家减半
- 激活引导能否捕捉多维度的作者风格?
- Atlas:在异构集群上优化复合人工智能工作流的部署
- TreeFI:面向深度神经网络的价值感知统计故障注入
- 超越同购关系:Allegro互补推荐系统的演进
- 追踪音频大语言模型中的音频基础与答案选择机制
- 无需拒绝的拒绝:安全微调响应的结构化分析与大语言模型误拒率的降低
- 基于未纠正几何畸变影像的卫星机载甲烷检测技术
- Qlippy:一个用于可复现量子工作流与实验追踪的检索增强型生成式AI助手
- CONTINUITY:面向可组合大模型智能体控制的安全上下文契约
- mHC 如何使用其残差流:选择性路由与近恒等混合
- 相变频率作为 ResNets 测试准确率训练阶段预测指标
- 抓住关键时机:诊断与提升视动模仿策略中的条件视觉基础定位
- 当大模型反编译工具“编译”更多却“保留”更少
- 历史即检测器:端到端执行CVE补丁历史
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- OR-Agent:连接演化搜索与结构化研究,实现自动化启发式设计
- 基于隐式推理的强大且高效的安全护栏
- GPTNT:基于《保持通话和炸弹不炸》的多模态智能体实时协作基准
- 续写与拒绝的博弈:大语言模型中续写触发型越狱的机制分析
- 廉价验证器,巨大的盲区:衡量降本级联架构的可靠性成本
- 智能体上下文破解:通过非结构化数据的自适应构建实现Token高效的数据推理智能体
- 在Atari Pong中改进强大智能体背后的弱世界模型
- 更少数据、更快训练:重复较小数据集通过采样偏差加速学习
- Golden Ruler:包含FP8、BF16、MXFP4及微标度格式位精确一致性向量的数字格式目录
- 语义叠加:利用超越Token和引导向量的注解技术缓解提示词注入
- SoK:AI 增强型二进制逆向工程知识系统化研究
- Octopus 协议:通过“提示词即基础设施”实现面向 AI 代理的一次性硬件发现与控制
- 并非所有大语言模型的推理过程都可见于思维链中
- 构造即可归因:面向多文档摘要的声明锚定溯源
- DeepAffinity:利用小型语言模型预测电子商务中的长期商品属性偏好
- SPD:生成式重排的单次前向传递解码方法
- LEED:用于GNN过平滑估计与虚拟节点选择的局部嵌入演化距离
- 保护性能力幻觉:当大语言模型声称拥有不存在的能力
- FVSpec:将现实世界基于属性的测试转化为 Lean 挑战
- 预训练进展主要来源于数据
- 记忆究竟何时有用?工具调用大语言模型智能体中长期记忆的成本感知评估
- 面向视觉与语言Transformer的感知损伤多臂老虎机剪枝技术
- AutoFyn 技术报告:面向长视角智能体的非参数专家迭代法
- ARC-Bench:闭环重规划掩盖了冻结 JEPA 世界模型中失效的动作排序
- HFresh:内存高效的向量搜索引擎
- CUSP:多智能体多模态推理的可分解集体不确定性
- 大语言模型交易智能体在生产环境中的实际表现:来自两个机群的长达六个月、群体规模的实录
- 从语言模型嵌入中恢复时间与地理信号
- 情感目标导向理论的计算实现
- 神经形态系统中结构吸引子的形成
- 学习用于部分可观测性下具身推理的反事实世界模型
- 蒸馏视觉语言模型以实现端侧火灾理解
- 超越提示词:大语言模型工具智能体外挂框架的度量与优化
- 《符文与魔法传说》中结合策略与价值网络的非完备搜索研究
- LLM因果先验何时以及为何有效:面向摊销因果推断的闭环先验选择
- 超越单次扩展:面向多跳检索的对比证据探索
- 早期编码、后期调用:Transformer在何时开始依据推断出的伙伴专业性采取行动
- 大语言模型中战略选择的内部解剖
- 面向目标导向对话编排的可审计符号-RAG-生成式AI架构
- 工业制造系统中用于多时域预测性维护的分位数引导特征提取
- 语言模型中的信念与行为
- 脱离引擎的评分:端到端验证生成式引擎中确定性且抗操纵的内容评分
- 量化放大确定性而非偏见:服务时权重压缩的尺度依赖行为效应
- iBrain:一个从脑表到脉冲的统一大脑读取基础模型
- 当智能转化为能动性:共生式AI系统的受控主动能动性理论
- 路由器先验偏置:在 MoE 后训练中保持基础路由结构
- 利用强化学习激发多模态推理代理的自我验证能力
- 通过基于SAE的引导解决知识冲突的关键路径识别
- CausalVerify:面向大模型因果推断工作流的执行接地基准测试
- GoAnt:基于质量-多样性多智能体搜索的市场微观结构数据Alpha因子挖掘
- 重形式轻实质:内容不变的外壳如何颠覆大模型安全评判器的裁决
- 已被撤销却依然具备权威性:对智能体记忆系统中撤销执行情况的实证研究
- 大型视觉语言模型中涌现的目标导向注意力
- 自对弈中近似价值迭代的惊人有效性
- SRPO:多智能体大语言模型的集合相对策略优化
- Concord:用于跨模态查询优化的视频关系代数
- TamilEOT:泰米尔语电话语音中语义轮次结束检测的数据集与模型
- 引君入瓮与恢复:通过投毒内部拒绝信号防御白盒编辑越狱
- 差异补丁 vs. 整体文件:Flutter/Dart 代码模型迭代编辑式与直接生成式的实证比较
- 面向长上下文大模型解码中密集片上NVM的接口感知KV缓存量化
- 声音去哪儿了?追踪音频条件大语言模型中的声学信息丢失
- 量子AI会梦见路径吗?基于Grover干涉的路径积分慢思考
- 大语言模型是否在“自食其言”:多轮交互中的因果历史效应
- ACE:MoE大语言模型参数高效微调的跨专家适配器合并
- 更大的文本编码器可能会损害 CLIP 的零样本性能
- Erdős 第1040号问题的解决方案
- 价格与交易动态的可解释深度学习:从黑箱预测到高效参数化模型
- 全为了1比特:迈向大语言模型真正的1比特训练后量化
- Scratchy:基于视觉草稿板的多模态推理在EasyCrypt密码学证明生成中的应用
- 高效注意力机制的线性代数基础:SVD压缩下秩坍缩的相位反转
- 基于值函数的强化学习中批归一化前向模式的研究
- 从高斯点到硅片:重新审视 3DGS 的计算效率
- 基于最优输运贝尔曼平滑的二阶平滑规划
- 通过迭代 DPO 从奖励作弊中诱发突发性不对齐
- 反词元化泄漏:从缓存痕迹重建本地大模型输出
- 多租户大模型服务中KV缓存定时侧信道竞争诱发的可靠性崩溃特征研究
- ECOKV:通过互补多样性度量实现几何感知的 KV 缓存淘汰
- 视觉语言模型中思维链忠实度的反事实测试评估
- 联邦学习框架下X射线透视中导管与导丝分割的新方法
- 面向智能体网络的类型化联邦构件:在冻结的异构LLM智能体间共享工具路由知识
- 人机协同发现可重构面内铁电超畴控制
- 拒绝的几何学:为什么事后安全机制如此脆弱,而预训练阶段的安全机制能够持久
- AgentDrift:带有步骤标签的提示词注入劫持大模型智能体轨迹基准
- 离线强化学习中扩散策略的噪声空间策略梯度
- 动态路由器需要记忆吗?HeRo:面向高效大模型推理的历史感知路由机制
- FreqBLiMP:频率受控的最小对立集揭示了大语言模型在词汇稀缺性下的稳健性与脆弱性
- 超全训练,紧凑部署:扩展结构化大语言模型剪枝的恢复能力
- 扩散语言模型中的原位指令遵循
- 并行策略链接实现快速训练收敛
- 重新编译远远不够:测试引导的反编译C代码修复
- Matryoshka 哈希表示:面向模型感知的紧凑语义检索
- steering 干扰反映了模型的默认倾向,而非行为方向本身
- 贝叶斯推断中结合马尔可夫采样器的热力学循环过程
- 超越单一负样本偏好:面向大模型历史实体链接的多负样本 DPO 方法
- 从引用到贡献:大模型辅助的研究论文贡献度评分
- 准确率并非全部:基于散度的方法评估量化大语言模型的保真度损失
- CodeTD:注意力拓扑结构检测代码大语言模型中的幻觉
- HOL 中的一元二阶逻辑:深层与浅层嵌入及自动化忠实性(扩展预印本)
- AI编程助手在安装前会进行安全检查吗?针对研究软件供应链中信任信号的预注册需求侧审计
- Ambient @ EgoProactive 2026:基于视觉基础监督的主动式第一视角辅助系统
- AI 模型如何管理认知权威:针对用户异议回应的分类法与比较分析
- 你无法偏好未曾采样的情感:DPO微调大语言模型中的强度不足现象
- PACE:面向 QoE 高效的检索增强对话服务的感知延迟自适应级联服务路由与填充词控制
- DeepSeek AI 发布 DeepSeek-V4.1-Flash:支持 1M 上下文、FP4 KV 缓存与跨层注意力复用
- MOSAIC:用于跨范式智能体混合与人机协作的通用智能体级接口
- Harbor Adapters与Harbor-Index:大规模智能体评估的基础设施与精选元数据集
- 递归语言模型训练中的脆弱性图谱
- VAE 与扩散模型的泛化能力:统一的信息论分析框架
- 少即是多:究竟是何种语音特征驱动了话轮结束检测?
- 无盒漏洞分析:仅凭元数据检测 MCP 服务器的间接提示词注入漏洞
- 基于循环流的思考:通过动态计算分配提升深度推理能力
- Magenta:闭环数学推理与 Lean 形式化验证
- Ambient @ EgoProactive 2026:基于视觉定位监督的主动式第一视角穿戴式助手
- FastE:基于读出触发的 LLM 嵌入推理 Token 压缩算法
- T1:面向长程终端任务的强化学习智能体
- LOCUS:面向高 Token 效率语言生成的任务感知低秩训练后优化
- REAL-Q:基于动态梯度下降的端到端大语言模型量化
- 当合成数据带来负面效应:大模型智能体技能检索中的灾难性遗忘研究
- 这不是一只烟斗:将 AI 系统视为语义抽象的形式化框架
- 面向高扇出智能体沙箱的内存压缩技术
- BenchShield:基于形式化模型的 LLM 智能体评测奖励完整性防护层
- 连续扩散语言模型在规模化扩展上可媲美离散扩散
- Ecdysis:面向大模型智能体运行时脚手架的高效进化训练
- 真相从未泯灭:顺从上下文真实性探针中的完全混叠现象
- LLM 如何遵循指令:多项语言技能的熟练协调,而非通用机制
- 在模型动摇处分叉:面向树状结构强化学习的信念转移分支策略
- HISA:面向细粒度稀疏注意力的高效分层索引机制
- 语用信息论的数学理论:统一通信、控制与决策
- VikingRAG:面向结构化文档的高精度与高 Token 效率检索增强生成
- 面向二进制对称信道的最优 (n,4) 二进制码 Dong-Yang 分类定理的机器验证证明
- 扎根智能体记忆:面向企业级智能体的环境探测式记忆管理
- PETSc 中 AI 生成科学计算代码的智能体评估框架
- OpenResearcher:用于长程深度研究智能体轨迹合成的完全开源框架
- 以具现化作为可迁移词表:使用原生图神经网络实现零样本链接预测
- 表征任务电力弹性:面向柔性电网的 AI 训练动态功率分配
- 解构 EGGROLL:大规模低秩进化策略的理论理解与改进
- 大语言模型中的知识归因探测研究
- 就绪与下发解耦:面向智能体大模型工作流的长尾感知调度
- 超越提示词工程:基于对数几率空间融合的语音大模型高效鲁棒上下文偏置 (LOGIC)
- 语义提升算子与保持性下不可判定类的闭包性
- 引入非基项子句学习拓展 SMT 求解能力
- 斩获 IMO 金牌的开源秘籍:面向奥林匹克数学的 Nemotron 训练实践
- DCO:基于预测性管理的面向大模型加速器动态缓存编排
- 从 MCP 注册表中随机抽取究竟能抽到什么?工具调用基准测试真相剖析
- GPU-CFR:通过编译为静态数据流与 CUDA Graph 重放实现 80 倍逆事实遗憾最小化加速
- ActMap:基于生成期激活特征图的单次推理不确定性量化
- terms.txt:面向智能体网络访问的知情同意与补偿协议
- 几乎零开销的状态-预测解耦架构
- UltraQuant:面向重度上下文智能体的 4-bit KV Cache 压缩技术
- AsyncFlow:面向高效大模型后训练的异步流式强化学习框架
- 基于 LoRA 与 HF Jobs 的异步 GRPO 训练:对象存储、代理与零 NCCL 实践
- mKernel:面向多 GPU 与多节点的高性能融合算子库
- 一个向量能容纳多少思维?叠加推理的表征容量
- OpWeave:面向异构大模型推理服务的灵活算子级解耦框架
- BlueLM-GUI 技术报告:面向自进化移动端 GUI 智能体的真机飞轮系统
- 谁来教授哪个 Token?面向科学推理的验证器门控多专家策略内蒸馏
- Stellar Colosseum:面向数学与理论计算机科学长程研究的多智能体竞技框架
- 突破 1.58 比特极限:三值大语言模型的极致压缩与加速
- 元认知引导:学习科学判断的内在结构
- 直接问工具,别瞎猜:智能体工具调用自带运行进度,推理系统理应主动读取
- VQ-bench:可组合式矢量量化框架与评测基准
- 4-bit 旋转量化技术深度剖析:消除离群值的极致压缩艺术
- FormalFlow:面向 MIP* = RE 核心定理的长程自动化形式化证明
- AI 智能体真的懂计算机体系结构吗?AutoTuring 基准测试揭示底层思考本质
- 当智能体执行提交:认知可串行化保障复杂系统一致性
- PrismML 发布三值大模型 Ternary Bonsai 2 27B:仅 5.9GB 体积保留 98.2% 顶尖性能