标签浏览
/proc
1比特量化
2048
2D工程图
3D CAD
3D Gaussian Splatting
3D MRI
3D 游戏开发
3DGS
3D医学图像
3D场景图
3D打印
3D混凝土打印
3D生成
3D空间推理
3D视觉
3D高斯泼溅
3D高斯溅射
4-bit 量化
5G
66号令
6G
6G通信
A-CEGIS
A-PACK
A/B测试
- LinkedIn的自进化智能客服系统
- 快速 A/B/n 测试:通过树耦合反馈共享实现精确的多策略比较
- AI智能体能够模拟A/B测试结果吗?智能体实验验证框架解析
- 快速 A/B/n 测试:通过树耦合反馈共享实现精确的多策略对比
A2A协作
A2A协议
ACM MM
ACM Multimedia
ADU框架
AGI
AGV调度
AI
AI Agent
- 智能体资源发现:让智能体自行搜索工具、技能与其他智能体
- 我们是如何让本地开源模型免费为 OpenClaw 仓库进行 Issue 和 PR 分流的!
- 将 hf CLI 设计为面向智能体的 Hub 交互优化工具
- 您自己本来也想提的 Pull Request:用代码智能体加速 MLX 语言模型移植
- 长 SKILL 合规性作为逻辑推理:基于闭包扎根检测与缩放引导的策略内蒸馏
- FluctlightDB:面向 AI Agent 的数据内存模型
- AHD Agent:用于自动启发式设计的智能体强化学习
- MobileMem:基于一年期移动端体验的学习研究
- StagedWorkspace:面向知识工作智能体的版本化工作空间
- AgentMercury:让你的智能体在大规模业务场景中自主合成可验证环境
- STAGE:基于策略限定上下文与确定性控制的有状态转换至智能体图执行
- ClawProBench:AI 代理的轨迹感知评估
- 从状态到行动:用于可靠多轮工具调用的 OODA-Tool
- WikiSkill:将智能体经验编译为持久化知识以实现技能进化
- 你的AI Agent能更省钱吗?探究任务规范对智能体编程任务中Token消耗的影响
- WikiSkill:将智能体经验编译为持久化知识以实现技能演进
- 你的AI Agent能更省钱吗?探究任务规范对智能体编码任务中Token消耗的影响
- String:一个让每个应用皆为 Markdown 文件的智能体操作系统
- 智能体插件的维护与共演化:Claude Code 插件市场的实证研究
- WHALE:联合优化框架与模型权重的简单方法
AI Agents
AI City Challenge
AI Models
AI PC
AI 形式化验证
AI 智能体
- Magenta:闭环数学推理与 Lean 形式化验证
- Ecdysis:面向大模型智能体运行时脚手架的高效进化训练
- 扎根智能体记忆:面向企业级智能体的环境探测式记忆管理
- 脚手架内部的上下文工程:战胜长程任务中上下文溢出与目标迷失的 4 大机制
- UltraQuant:面向重度上下文智能体的 4-bit KV Cache 压缩技术
- 直接问工具,别瞎猜:智能体工具调用自带运行进度,推理系统理应主动读取
- AI 智能体真的懂计算机体系结构吗?AutoTuring 基准测试揭示底层思考本质
- 当智能体执行提交:认知可串行化保障复杂系统一致性
AI 编程
AI 证明智能体
AIME
AIOps
AISAC
AI与SQL
AI代理
- 无法追责的授权、日渐衰退的技能:绘制职场AI代理的风险图谱
- Mechanist:将人工智能作为探索智能机制的科学仪器
- 快节奏与硬核代码
- 超越授权指令:代理支付协议(AP2)的系统性安全分析
- 面向人类与机器代理的文学化编程环境
- Octopus 协议:通过“提示词即基础设施”实现面向 AI 代理的一次性硬件发现与控制
AI代码评审
AI共同科学家
AI内存
AI分析
AI加速器
- Maia 200:面向大规模AI加速的软件定义数据流系统
- Redwood:由AI在两周内从零设计、验证并部署的前沿AI加速器
- Redwood:由AI从零开始设计、验证并在2周内部署的前沿AI加速器
- DCO:基于预测性管理的面向大模型加速器动态缓存编排
AI助手
- 使用 Postgres 构建个性化 AI 助手
- 企业级AI安全指南:面向开发者的NeMo Guardrails实践教程
- Ansari:一个基于检索增强的伊斯兰AI助手——14万次对话的架构、部署与经验教训
AI助教
AI可靠性
AI基准测试
AI大模型
AI天气预测
AI安全
- 当经验化为指令:自进化智能体技能系统中的轨迹投毒
- NiyamAI:一个基于零知识证明构建、具备密码学可验证护栏的意图绑定型AI智能体
- HarnessSafe:评估智能体外壳中持久化载体的安全性
- 反事实模拟训练:提升思维链的忠实度
- 并非真正的无障碍:Android辅助功能如何将移动端AI智能体暴露于间接提示词注入风险中
- 提示词注入的解构:一种用于结构化分析的组件模型
- 智能体安全性应当是一项运行时契约
- 单周期智能体自归纳下AI护栏的生存状况
- BrowseSafe:理解并预防 AI 浏览器智能体中的提示词注入
- PIPES:通过溯源与先验知识保障智能体感知安全
- 合成角色预训练:从第零个Token开始的对齐
- 可审计智能体:保障大语言模型智能体部署后的责任与透明度
- TRUSS:迈向任务可靠与用户安全的自动化智能体技能生成
- 超越可疑步骤:长程智能体的本体论信任
- RULER:机器遗忘的表征级验证
- 语言模型认为谁更有能力?职业偏见的机械可解释性分析
- 效用遭受攻击:智能体记忆投毒与内容筛选及溯源排名的局限性
- HANSARD:面向自主多智能体AI系统的取证就绪、运行时见证与分级归因参考架构
- 智能体脚手架会放大大型语言模型的谄媚行为
- 并非所有评测觉察都千篇一律:能力框架可预测合规性
- 并非所有的评估感知都生而平等:能力框架预示着合规性
- 超越 F1 分数:评估 AI 模型安全扫描器的覆盖率与故障恢复能力
- NiyamAI:基于零知识证明的具备密码学可验证护栏的意图绑定型AI智能体
- 评判评判者:将拉施测量理论引入大模型评估
- 自主性税:防御训练破坏了 LLM 智能体
- 自发欺骗与受指令欺骗中的不对称性
- 从欺骗性输出到欺骗性机制:语言模型欺骗研究的因果框架
- ObserverBench:测试用于干预和控制的机械解释估计器
- 将间接提示词注入重新构想为测试时搜索问题
- AI编程助手在安装前会进行安全检查吗?针对研究软件供应链中信任信号的预注册需求侧审计
- 无盒漏洞分析:仅凭元数据检测 MCP 服务器的间接提示词注入漏洞
AI安全与评估
AI审稿
AI对齐
- 智能体物理学:统计力学预测人工智能群体的集体行为
- HarmProfile:刻画前沿大语言模型中的有害分布
- 不完美对齐下的价值脆弱性
- VA-DPO:用于语言模型可控情感生成的效价-唤醒度直接偏好优化
- 衡量大语言模型中的激活控制能力
- 算法影响揭示对齐中隐藏的社会选择结构
AI开发
AI开源模型
AI推理
AI文本检测
AI日记
AI智能体
- 调用还是不调用:评估与优化大语言模型工具调用的框架
- InsightEmb:学习用于智能体洞察检索的动作-意图嵌入
- AI智能体能否进行开放式AI研究?两项案例研究的初步证据
- OpenForgeRL:在任意环境中训练 Harness 原生智能体
- TelemetrySuffBench:智能体遥测数据是否足以进行故障根源诊断?
- 是什么阻碍了智能体技能的复用?来自 138K 个 SKILL.md 文件的实证研究
- 脚手架的重要性胜过接口:对七种智能体脚手架、五种语言模型以及一项软件任务中 MCP 与 CLI 工具调用的对照比较
- InfraBench:跨层级、全生命周期与风险评估的基础设施智能体基准测试
- 智能体网络安全的下一个挑战:一个现实且无污染的逆向工程基准
- 我们通过复现2200篇ICML论文学到了什么
- MindMemOS:面向AI智能体的可移植自进化内存操作系统层
- 交互就绪性:构建与评估人类角色 AI 智能体的框架
- Vero:AI智能体能够构建形式化验证的软件代码库吗?
- HELIX:面向递归自我提升的模型与运行壳协同演化
- AI智能体能够模拟A/B测试结果吗?智能体实验验证框架解析
- 观点:科学团队中的AI智能体应作为人机系统进行研究
- 上下文压缩给AI智能体带来了什么代价?被任务完成指标掩盖的交互成本
- 迈向无风险的AI智能体部署
- SkillGate:长程智能体中策略内技能选择的训练方法
- 机器上的机器科学:计算化学中的AI智能体
- monday.com 是如何将其平台转型为人类与智能体协作的“智能体优先”产品的
- 解码 AI:智能体循环架构与供应商经济学
- 终端智能体:命令行环境下的 AI 智能体综述
- BC-Bench:评估面向 ERP 领域特定语言的智能体工程能力
- 少读多解:面向AI智能体的Token高效稀疏阅读技术
- 长运行 AI 智能体内存中的“压缩悬崖”现象
- CMI-Mem:通过CMI增强强化学习实现具备泛化能力的长期记忆管理
- InfraBench:跨层级、全生命周期与风险维度的基础设施智能体评估基准
- 超越可执行模型:用于物理系统建模的 Pufibara 智能体框架与 Modelica 智能体工作流基准
- Simthesizer:面向大模型推理服务系统的智能体驱动仿真框架
- SuperLocalMemory 4.0:面向AI智能体的受管控内存操作系统
- SimVerity:模拟智能体成功何时能在物理部署中转化为现实?
- SimVerity:模拟智能体成功何时能在物理部署中持续?
- Vercel 开源 vgpu:面向 AI 智能体着色器的 TypeScript WebGPU 库
- CrabOS:人机共栖操作系统
- mimeo:将公开专家文集编译为智能体技能并测试知识迁移
- 运行时独立的持久化智能体:跨模型、框架与服务器保持身份、记忆和代码的连续性
- SimSkill:用于自主掌握交通模拟的终身学习AI智能体
- 接口诱导的轨迹审查:AI智能体评测中的静默失效
- 具备底层感知能力的AI智能体:将执行上下文作为一等输入
- 你的智能体记忆能经受住模型升级的考验吗?记忆可移植性的对照研究
- PETSc 中 AI 生成科学计算代码的智能体评估框架
- terms.txt:面向智能体网络访问的知情同意与补偿协议
AI检测
AI模型
AI治理
AI理论
AI生态系统
AI研究
AI科学家
AI科研
AI编码代理
AI编码智能体
AI编程
AI编程智能体
AI评估
AI评测
AI诊断
AI谄媚
AI辅助数学
AI隐私
ALTK-Evolve
AMD Instinct MI355X
AMRA
ANML
APC
API
ARC-AGI
ARC-AGI-2
ARCTIC系统
ARD
ASE 2026
ASIL
ASR
AT&T
AVR
AVR微控制器
AWQ
AWS
ActivityPub
AdaSkill
Adam优化器
AdaptRubric
AeroRealtime
Agent
AgentAuditor
AgentSysBench
AgentWeave
AgentZip
Agentic AI
Agentic Memory
Agentic Search
Agent技能
AkasicDB
AlphaFold
AlphaZero
Alpha世代
Alpha因子
AnalyticDB
AndroidReality
Android无障碍
Anthropic
Anubis
Apache Iceberg
Apple Silicon
ArUco
AstronOS
Asymptote
Atari
Atari Pong
AtlasNav
AudioTQ
Auto-Research
AutoFyn
AutoML
AutoTuring
Azure
BBC Master
BERT
- ECG-LENS:融合导联感知与临床上下文的心电图报告生成与评估
- 利用 Poly-Encoders 实现计算高效的自动化创造力评估
- 使用多重编码器实现计算高效的自动化创造力评估
- Softmax 注意力的近似秩:尖锐的几何规律与鲁棒的交互维度
BFI-Adapt
BIOS修复
BITCOS
BLiMP
BMVC 2026
- 排序与分配:多视角目标关联中的指标不匹配问题
- X\(^2\)Localizer:用于渐进式跨视角视频地理定位的跨粒度对齐方法
- X\(^2\)Localizer:用于渐进式跨视角视频地理定位的跨粒度对齐框架
BPCO
BabyLM
Batch Size
BenchDrift
BenchShield
Benchmark
BiCache
Bioinformatics
BiomedCLIP
BixBench
BlueLM
Bluesky
Boltz-1
BraTS挑战赛
Brick
C++
C/C++
C2PA
C2Rust
CAD
CAP框架
CAR-bench
CDISC
CGMES
CGSReg
CI/CD
- 结合AI、开源工具与人工介入:实现
huggingface_hub的每周迭代发布 - Supabase CLI v2:实现配置即代码 (Config as Code)
- Forgejo 技巧 #2:与 Read the Docs 集成
CLAUDE.md
CLI
CLIP
CM5
CNC加工
CNOT优化
CNOT门
COLM
COLM2026
COLREGs
COM
COMPINT
COVID-19
CPMpy
CPU优化
CPU推理
CPU缓存
CRAFT
CRDT
CRISPRi
CS2
CSI反馈
CSP
CTIForge
CT图像重建
CUDA
- CUDA-L2:通过强化学习超越 cuBLAS 的矩阵乘法性能
- 在连续批处理中解锁异步性:将大模型推理速度提升 20% 以上
- GPU-CFR:通过编译为静态数据流与 CUDA Graph 重放实现 80 倍逆事实遗憾最小化加速
CUDA优化
CVE补丁
CVSS
CXL
Cal.com
CalibRank
Causal Graph
Cgroup
Cgroups
Chain-of-Thought
ChatGPT
Chrome扩展
Chrony
Claude
- 使用 Claude Fable 5 一次性成功构建浣熊抢劫 3D 游戏
- monday.com 是如何将其平台转型为人类与智能体协作的“智能体优先”产品的
- Claude 如何为 AI 生成的文本添加水印
- 使用 Claude 修复 eMachines EL1200 主板 BIOS 漏洞
- 修复 NZXT Signal 4K30 采集卡 (第二部分):攻克绿粉色画面显示异常
Claude Code
- 使用 Claude Fable 5 一次性成功构建浣熊抢劫 3D 游戏
- PrimeAgentOrchestrator:面向个人 AI 基础设施的记忆预加载智能体衍生系统
- 智能体插件的维护与共演化:Claude Code 插件市场的实证研究
- 脚手架内部的上下文工程:战胜长程任务中上下文溢出与目标迷失的 4 大机制
ClickHouse
Clos架构
CoBa
CoDE-Stop
CodeQL
CogVis
CommonCrawl
Compiler Explorer
ComponentBench
Computer Vision
Conformal Prediction
Conway99图
Copula
CoreSec
Cosmos-H-Dreams
Counter-Strike 2
CrabOS
Cron
CulTrace
Cursor
C语言
D3-Omni
DAG
DARTS
DBOS
DINOv3
DIY
DLLM
DPO
- 开源权重模型的行为重编程:认知可塑性与对齐边界
- MINT:用于平衡多目标对齐的最小选择偏好蒸馏
- 上下文对齐增益由预存在机制介导:GRPO、SFT与DPO的审计分析
- 通过迭代 DPO 从奖励作弊中诱发突发性不对齐
- 超越单一负样本偏好:面向大模型历史实体链接的多负样本 DPO 方法
- 你无法偏好未曾采样的情感:DPO微调大语言模型中的强度不足现象
DPPO
DRY
DSL
DVFS
Dan Abramov
Dart
Databricks
DeMARS
DecPOMDP
Deep Research
DeepSeek
DeepSeek-V4-Flash
Delta-Rule
DevOps
DiDPO
DiT
Diffusers
Diffusion LLM
Diffusion Language Models
Diffusion Transformers
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- Shiva-DiT:用于高效扩散 Transformer 的基于残差的可微分 Top-\(k\) 选择方法
Direct Preference Optimization
DistilBERT
Docker
Dropout
Dyna架构
ECCV 2026
EDA
- 大语言模型用于Verilog代码生成:文献综述与未来之路
- 数字EDA中的大语言模型:从生成到编排的角色转变视角
- Analog-DB:面向Agent的模拟集成电路数据库,从模块到系统
- LevelSyn:基于层异步图神经网络的物理感知逻辑综合
EEG
EGGROLL
EMNLP
- 人类评估中的真实性鸿沟
- 目标感知的校准数据选择:在量化语言模型中保持不确定性
- OVIBench:面向中断场景的在线视频问答基准测评
- ASIL:用结构化状态与语义动作取代截图点击式交互
- ExecRubrics:用于可验证且高效长文本评估的可执行工具增强评分准则
- VICT:面向长视距大模型智能体强化学习的验证器注入信用追溯
- 无证据提示:神经影像提及如何改变临床视觉-语言模型的预测
- ExecRetrieval:衡量代码嵌入检索中的功能正确性差距
- 韩国开源公共API的多步工具调用:基准测试与数据合成配方
- 激活引导能否捕捉多维度的作者风格?
- 超全训练,紧凑部署:扩展结构化大语言模型剪枝的恢复能力
EMNLP 2026
- SA-Bench:评估基于大语言模型的论文复现中的语义对齐
- 语言模型会遵循奥卡姆剃刀原理吗?归纳与溯因推理中的简约性评估
- GOD:治理、观察与指挥 —— 智能体社会的实时控制室
- REINS:基于稀疏自编码器特征的拒绝增强抑制性调控
- 当安全路由失效:解析良性微调下的对齐脆弱性
- 为扩散语言模型启用共享前缀的 KV 缓存
- Dude:用于论文与代码差异检测的双重检测多智能体系统
- 激进解码期 KV 淘汰的关键要素:时间聚合与排序保持
- 倾听潜变量:通过大音频语言模型中的隐状态交互实现自纠错语音识别
- 无需拒绝的拒绝:安全微调响应的结构化分析与大语言模型误拒率的降低
- 超越提示词:大语言模型工具智能体外挂框架的度量与优化
- FreqBLiMP:频率受控的最小对立集揭示了大语言模型在词汇稀缺性下的稳健性与脆弱性
EMNLP2026
- WorldLines:长时序具身状态智能体的基准测试与建模
- LLM4LLM:通过闭环智能体优化弥合内核基准与真实部署的差距
- 坦白你所知:大语言模型遗忘中“遗忘集与模型知识错位”问题研究
- 评价评估者:将拉斯施测量理论引入大语言模型评估
- 替我发言:赋予大语言模型参与会议的情境感知能力
</think>无法停止推理:虚假思维链终止现象分析- 人类心理测量问卷错误表征了大语言模型的行为
- 并行策略链接实现快速训练收敛
EMNLP26
ERA5
ERP
EasyCrypt
Eclipse插件
Ecosyste.ms
Edge Functions
- 使用 Supabase Edge Functions 和 mcp-use 构建 ChatGPT 应用
- 使用 Edge Functions、Cron 和队列处理大规模任务
- Supabase Edge Functions 重磅更新:引入后台任务、临时存储与 WebSocket 支持
Emacs
EmoUpdate
EnvACE
EquiReview-R
Erdős问题
Expo
FAISS
FDW
- 为 Postgres 外部数据包装器(FDW)添加异步流式传输支持
- 使用 Postgres 外表封装器 (FDW) 实现日历集成
- 在 Postgres 中使用 Wasm 外部数据包装器(Foreign Data Wrappers)
FHE
FHWA
FP4训练
FP8
Failure Attribution
FastAPI
FastE
Few-Shot Learning
FinLLM
FinQA
FinalityBench
Fisher信息矩阵
FlashAttention
Flow Matching
FluctlightDB
Flutter
Forgejo
Fortran
FraudBench
FusionDetect
GAMESS
GCPO
GEO
GEO防御
GGUF
GHarchive
GLM-5.3-Flash
- GLM-5.3-Flash 对比 Qwen3.8-Flash-Next:两家中国 AI 实验室如何独立收敛于相同的模型架构
- Z.ai 详解基于 10 万张国产芯片的 GLM-5.3-Flash 推理系统架构构建
GLU
GNN
GPS
GPT-2
GPT-5
GPTQ
GPU
GPU 优化
GPU优化
- 在连续批处理中解锁异步性:将大模型推理速度提升 20% 以上
- Ready Cohorts:LLM 智能体控制中的 GPU 机会边界与主机往返优化
- PTXBench:利用架构专用 PTX 评估与适配大语言模型以进行 GPU 核函数优化
- HIERA:针对GPU内核优化的跨实现空间工作负载感知规划
- KernelArc:面向GPU内核优化的多智能体框架
- 使用超低比特量化模型拓展大语言模型推理的极限
GPU优化学
GPU内核优化
GPU加速
GPU推理
- 面向存算分离 GPU 推理的拓扑感知数据传输技术
- 面向大规模 GPU 推理的 KV Cache 预测性多层内存管理
- Perplexity 详解其 GPU 嵌入技术栈:Ivy、Tulip 和 ROSE 如何支撑 pplx-embed
GPU调度
GRACE卫星
GRPO
- LC-GRPO:通过朗之万修正弥合基于流的 GRPO 训练与推理差距
- 全象限有界裁剪 GRPO:消除无界盲区以实现稳定且泛化的训练
- CAS:通过自适应检索与策略加权的保形智能体搜索
- Tournament-GRPO:面向开放式长文本生成强化学习的组内锦标赛奖励机制
- 最佳实践评判器优化 (BPCO)
- 上下文对齐增益由预存在机制介导:GRPO、SFT与DPO的审计分析
- 通过 100 步 GRPO 微调 350M 模型以获得更好的结构化输出
- GRPO中隐藏的虚假优势
- DRACO:基于动态评分标准的长期智能体训练细粒度信用分配
- F-GRPO:别让你的策略只学显而易见的常识,而遗忘那些稀缺的解
- 多套具现强化学习学到了什么?编码智能体中的归因与可迁移性
- SQL-Zero:自我进化的 Text-to-SQL
- 基于 LoRA 与 HF Jobs 的异步 GRPO 训练:对象存储、代理与零 NCCL 实践
GSM-Symbolic
GUI
GUI Agent
GUI Agents
GUI代理
GUI定位
GUI智能体
- ST-Lite:面向长程 GUI 智能体的免训练空间轨迹引导 KV Cache 压缩框架
- WM-R1:通过强化学习训练具备推理与世界模型利用能力的GUI智能体
- 多模态GUI智能体是否知道何时停止操作?实现具备冲突意识的终止机制
GUI自动化
Garbage Collection
Gas优化
Gated DeltaNet
Gated-BEPO
Gemma 3
Gemma 4
Gemma-2
Gemma-3
Geneformer
GeoAI
GeoExplain
Ghcid
Git
- 仓库中的问题追踪:探索去中心化基于 Git 的问题追踪系统
- 大规模 Git 架构演进:Cursor 的 Continuity 架构解析
- Git 子模块作为包管理器
- 重构 Packfile:在对象存储上直接运行 Git 的架构实践
GitHub
GitHub Actions
GitHub Copilot
GitHub工作流
GitOps
Go
Google Discover
Goroutine
Go语言
Gradio
Granite 4.1
GraphRAG
Grover放大
Gymnasium
HAFR-Net
HDMI
HFresh
HLS
HNSW
HPC
HTML
HTN规划
HTTP Signatures
Hacker News
Hadamard变换
Hadamard矩阵
Harbor-Index
HarmProfile
HarnessLens
Haskell
High-Throughput Serving
Homelab
Hopfield网络
Hugging Face
- Hugging Face 模型现已登陆 Foundry Managed Compute
- 结合AI、开源工具与人工介入:实现
huggingface_hub的每周迭代发布 - 智能体资源发现:让智能体自行搜索工具、技能与其他智能体
- 超越LoRA:你能打败最流行的微调技术吗?
- 为 Reachy Mini 添加 MCP 工具支持
- 将 hf CLI 设计为面向智能体的 Hub 交互优化工具
- 使用 Hugging Face Bucket 传输万亿参数:TRL 中的 Delta 权重同步机制
- 使用 Strands Agents、LeRobot 和 Hugging Face 存储桶在单一平台完成录制、训练与部署
- Hugging Face Inference Endpoints、Jobs 和 Buckets 如何驱动 Papers with Code 的搜索功能
- 介绍 @huggingface/kernels:面向本地 AI 的 200 多个 WebGPU 核函数
- 为你的编码智能体赋予属于你自己的记忆
- 基于 LoRA 与 HF Jobs 的异步 GRPO 训练:对象存储、代理与零 NCCL 实践
HybridProver
I/O感知
IBM
ICBQ
ICDM 2026
ICLR 2025
ICML
ICML 2026
- 当草稿模型在进化:投机解码与在线学习的完美结合
- 立场:推理是一个基于规则的可学习过程
- 利用交互作用评估与解释大语言模型的提示词敏感性
- 检索失效于开始之前:智能体记忆中作为保持失败的结构性间接前置条件驱逐
- SRPO:面向长视野推理的自反思策略优化
- 位置即全部:基于多模态大语言模型的指代表达式分割免训练Token压缩策略
- Think-at-Hard:用于提升推理能力的动态循环 Transformer
- ScoreMix:利用扩散模型中的分数组合生成合成数据以提升识别性能
- 基于最优输运贝尔曼平滑的二阶平滑规划
ICML2026
- 观点:是时候优化大语言模型的自洽性了
- Dream-MPC:基于潜在想象的梯度模型预测控制
- 字里行间:法律模拟中行为真实性的建模与评估
- 位置即全部:基于MLLM指代表达式分割的免费午餐式Token压缩策略
ICU预测
IC设计
IMO 竞赛
IMU
IPC 2023
IP地理定位
ISWC 2026
IT变更管理
IT基础设施
Image Segmentation
Information Retrieval
Infra Agent
InfraBench
InnerExpert
Intel Loihi 2
InternGeometry
Invariant Structural Learning
InvestLogicBench
Isabelle/HOL
JAX
JEPA
- 你的概率式JEPA暗中其实是一个隐马尔可夫模型:联合嵌入预测学习的状态空间解释
- 无需高斯假设:面向 JEPA 世界模型的对比逆动力学
- BRo-JEPA:在潜空间中学习模块化变换
- Var-JEPA:联合嵌入预测架构的变分公式——弥合预测式与生成式自监督学习
- 迈向面向目标条件化机器人规划的物理基础 JEPA 世界模型
- ARC-Bench:闭环重规划掩盖了冻结 JEPA 世界模型中失效的动作排序
JSON
JSON Schema
Jaccard距离
Jacobian透镜
JavaScript
K-Bench
KAN
KIVI
KL散度
KV Cache
- 异构注意力内存的运行时可观测性
- 你的 KV 缓存不是比特问题,而是几何问题
- 基于自适应注意力匹配的推理过程思维感知 KV 缓存压缩
- Sigmoid Attention:构建学习型 KV 缓存淘汰的更优底层架构
- Minima-KV:采用混合格式分页注意力的保持保留型 KV 缓存压缩技术
- KV缓存淘汰的概率解释
- 面向上下文密集型任务的 KV 缓存卸载技术
- HeadWiseKV:混合长上下文语言模型的按头预算化缓存驻留机制
- ECOKV:通过互补多样性度量实现几何感知的 KV 缓存淘汰
- UltraQuant:面向重度上下文智能体的 4-bit KV Cache 压缩技术
- 直接问工具,别瞎猜:智能体工具调用自带运行进度,推理系统理应主动读取
KV Cache压缩
KV Caching
KV-Cache
KV-cache
KV压缩
KV缓存
- 注意力头的自主性:利用冻结的查询-键几何实现免数据的稀疏注意力机制
- 面向大规模 GPU 推理的 KV Cache 预测性多层内存管理
- 管理KV缓存:防止多租户大模型推理中的定时侧信道泄漏
- vToken:面向可回收 KV 缓存的Token级虚拟化技术
- Transformer 需要三个投影吗?QKV 变体的系统性研究
- Kalypso:关系型大模型推理服务系统
- KV-Rescue:通过逐步交织恢复推理语言模型的KV缓存淘汰损失
- 分数衰减 KV 缓存:面向对话系统推理相关性优化的所有权感知内存管理
- KVBoost:基于偏差引导重计算的块级键值缓存重用技术,助力高效大模型推理
- LOCKS:用于高效长文本解码的页局紧凑键摘要
- 潜在通信何时真正发挥作用?多智能体大模型中中继KV缓存的因果审计
- 隐式通信何时真正奏效?多智能体大模型中中继KV缓存的因果审计
- CacheBridge:高效的跨模型 KV 缓存传输
- 语言模型能够自主控制注意力
- GrowPage:用于高效大模型推理服务的按需 KV 预算管理
- 面向长上下文大模型解码中密集片上NVM的接口感知KV缓存量化
- 多租户大模型服务中KV缓存定时侧信道竞争诱发的可靠性崩溃特征研究
- DeepSeek AI 发布 DeepSeek-V4.1-Flash:支持 1M 上下文、FP4 KV 缓存与跨层注意力复用
KV缓存优化
KV缓存压缩
KV缓存量化
Kimi 2.6
Kimi K2.7
Kimi K3
Kolmogorov-Arnold Networks
Krohn-Rhodes分解
Krum
KubeAstra
Kubernetes
LAB-Bench 2
LAMaS
LEGO-RL
LFM2.5
LLM
- vLLM 原生速度 Transformers 模型后端
- 编程智能体的在线监控与纠偏导向
- 可信智能体网络:智能体网络中的信任必须是原生构建的,而非事后补救
- 深思熟虑,一语中的:ReLIT,一种递归潜在隐式 Transformer 框架
- PolicyKG:将机构政策转化为 SHACL 知识图谱的智能体 LLM 流水线
- 措辞效应:量化大语言模型基准测试中的双向漂移
- Ready Cohorts:LLM 智能体控制中的 GPU 机会边界与主机往返优化
- MARC v1:用于临床 AI 推理与协作的开源多智能体框架
- 大语言模型赋能的社交媒体机器人检测系统的攻击与防御
- DumpsterCluster:从“垃圾堆”到运行 LLaMA-70B 的 60 美元 GPU 集群
- 从大模型推理到智能体工作负载:服务系统的特征分析与启示
- 大语言模型何时真正有效?评估 LLM 作为数据质量标注工具的效能
- Hacker News 上有多少内容是 AI 生成的?
- 我的 agent.md:如何利用它提升大模型辅助编程的代码质量
- 利用大语言模型为我的图标库制作色彩元数据丰富工具
- Nexus:面向统一内存中智能体大语言模型的深度自适应 KV 缓存拼接与检索解耦工具路由
- 加权记忆树:为长程 LLM 智能体保留关键信息
- 上下文即环境:面向长程智能体的程序化上下文管理
- 从 SQL 生成到工具选择:一种面向领域的 MCP 服务器模式
- 分久必合:三大 LLM Agent 框架的架构趋同
- pro-team 在 LLMs4OL 2026 的表现:用于本体学习的检索增强生成与词汇约束过滤
- 嵌套字节级词表部署成本低但共享代价高:一项预注册的否定性结果
- 推导 OpenEuroLLM 模型的缩放定律:学习率、批大小与损失
- 不要让模型直接写 YAML:基于大模型字段变更的确定性、最小差异 GitOps 修复方案
- 保持统计严谨性的重要性:对 GSM-Symbolic 的批判性重新评估
- 潜在的力量:AI时代黑客技术的趋同与独立思考的反思
- MaxKernel:面向 TPU 的智能体内核生成
- 超越提示词:大语言模型工具智能体外挂框架的度量与优化
LLM Agent
- Gated-BEPO:面向大语言模型智能体的置信门控贝尔曼信用分配
- Agent libOS:面向受能力控制的自进化大模型智能体的运行时底层架构
- LEDGER:用于审计 LLM Agent 的声明-证据追踪图
LLM Agents
LLM Pretraining
LLM Serving
LLM-as-a-Judge
LLM-as-a-judge
LLMLingua-2
LLM代理
LLM安全
- CompoSkill:由单个扫描通过的LLM智能体技能构成的组合式技能链攻击
- 安全性无法组合:自主LLM智能体的非衰减循环状态
- 相比于谁?大语言模型生成基础设施即代码(IaC)的人类锚定安全基准
- Agent Tools Orchestration 泄露更多:数据集、基准测试与缓解策略
LLM工程
LLM推理
- FluxBin:通过算法与算子协同实现基于灵活查找表的超低比特大模型推理
- 更多 GPU 还是更小的缓存?大语言模型推理中张量并行与 KV 压缩的内存受限服务博弈
- Simthesizer:面向大模型推理服务系统的智能体驱动仿真框架
- 使用超低比特量化模型拓展大语言模型推理的极限
LLM智能体
- LLM智能体能进行理性谈判吗?基于A2A/MCP协议的可验证多智能体交互机制设计框架
- 同行投票LLM智能体压力测试:发现信息流诱导的词汇趋同,但分布式来源并未带来可靠的匹配曝光优势
- 无真实标签的信用分配:基于执行重放对大模型智能体步级信用分配进行审计
- 角色与执行分离:在执行审计下演进LLM智能体的架构模式
- 自主性税:防御训练破坏了 LLM 智能体
- trajectory-judge:仅看结果的 LLM 评判器在评估智能体轨迹时遗漏了什么
- 用于加速工具使用型智能体的推测性宏指令提交(Speculative Macro Commit)
LLM架构
LLM角色
LLM评估
LLM评测
LLaMA 3.1
LOCUS
LOGIC
LOO-ROLL
LSABRE
LSP
LTN-GAN
LZ77算法
LanceDB
LangChain
Large Language Models
LeRobot
- Grabette:用于录制机器人操作数据的开源系统
- LeRobot v0.6.0:想象、评估、改进
- 使用 Strands Agents、LeRobot 和 Hugging Face 存储桶在单一平台完成录制、训练与部署
LeVJEPA
Lean
Lean 4
- 异构注意力内存的运行时可观测性
- P^3:用于验证代码生成的联合程序与证明规划
- 超越正确性:基于 Lean 4 实现自动化新颖性验证
- 运行时压缩风险定价:压缩服务状态的随时有效准入与服务输出定律
- FVSpec:将现实世界的基于属性的测试转化为 Lean 挑战
- AutoGraphForge:迈向图论的自动化发现
- FVSpec:将现实世界基于属性的测试转化为 Lean 挑战
- Magenta:闭环数学推理与 Lean 形式化验证
- 面向二进制对称信道的最优 (n,4) 二进制码 Dong-Yang 分类定理的机器验证证明
- FormalFlow:面向 MIP* = RE 核心定理的长程自动化形式化证明
- 我是如何借助 AI 与 Lean 证明康威50年猜想的:Dan Abramov 的一月通关实录
Lean定理助手
Lean定理证明
Lean定理证明器
Learning Rate
Learnware
Legend-State
Lenia
Linux
- 追踪一个 Zsh 历史记录数据丢失漏洞 🐞
- 当文件系统卸载时如何停止 Systemd 服务
- Systemd 启动缓慢之谜:一次排查经历
- 周末趣谈:你的进程内存其实就是一个文件
- Systemd 用户服务单元与特殊 Shell 带来的意外挑战
- 使用 PAM 阻止 SSH 登录(至少在 Linux 上)
- 我们不再使用 Linux 的严格内存超售模式
- 你应该使用无根容器(Rootless Containers)
- 2026 年各类 Unix 系统的平均负载机制深度剖析
Linux内存
Linux内核
Linux提权
Linux管理
Linux系统管理
Liquid AI
LiquidAI
Llama-3.1
LoCA
LoRA
- 超越LoRA:你能打败最流行的微调技术吗?
- LoCA:视觉基础模型的空间感知低秩卷积自适应
- IFCLoRA:面向参数高效微调的拓扑感知秩分配方法
- 不同的反馈,不同的更新:大语言模型基于用户交互的选择性自学习
- CosmosAlign:适配世界基础模型以实现生成式交通视频预测
- 轻量级微调下的路由器敏感性识别混合专家模型中的可剪枝专家
- SDS-LoRA:克服低秩适应中的各向异性梯度缩放
- 只需少数几个样本:MedSAM3高标注效率LoRA微调的实证研究
- BLADE:大语言模型遗忘的双层低秩增广拉格朗日擦除方法
- SplitLite:用于拆分学习的低秩残差压缩技术
- 能缩小到什么程度?使用 LoRA 对 270M-8B 模型进行金融交易商户信息提取微调
- AirLLM:基于扩散策略的自适应 LoRA,用于大语言模型的无线远程微调
- LoRA 作为预言机:基于低秩适配器的神经网络隐蔽后门审计与消除
- 跨四个国际胸部X光队列的BiomedCLIP联邦LoRA自适应研究
- TaRA:感知训练过程的低阶适应初始化方法
- 学会选择而非重新学习:基于硬路由推理 LoRA 混合模型
- ACE:MoE大语言模型参数高效微调的跨专家适配器合并
- 基于 LoRA 与 HF Jobs 的异步 GRPO 训练:对象存储、代理与零 NCCL 实践
LoRA微调
LoSA
Local-first
Logic Gate Networks
Logit Lens
Logit分析
Logit引导
LongEarth
LongRCA Bench
LookBack
MBA-Bench
MCP
- 截图还是工具?混合 GUI-MCP 计算机操作智能体中的工具调用与多模态上下文管理
- 智能体资源发现:让智能体自行搜索工具、技能与其他智能体
- 为 Reachy Mini 添加 MCP 工具支持
- 安全使用 Supabase MCP 与大语言模型:防范提示词注入与深度防御指南
- 使用 Supabase Edge Functions 和 mcp-use 构建 ChatGPT 应用
- LLM智能体能进行理性谈判吗?基于A2A/MCP协议的可验证多智能体交互机制设计框架
- 从 SQL 生成到工具选择:一种面向领域的 MCP 服务器模式
- 企业级MCP网关的混合语义工具发现:架构与实现
- 从 MCP 注册表中随机抽取究竟能抽到什么?工具调用基准测试真相剖析
MCP协议
MD5
MEMENTO
MILP
- 并非所有问题都适合建模为 MILP:一种面向 DSL 的灵活且精确的优化建模框架
- FLARE:利用基于大语言模型的定理证明验证混合整数线性规划重构
- FLARE:利用基于大语言模型的定理证明验证 MILP 重构
MIMIC-IV
MIMO
- GSBF:面向环境感知波束赋形的 3D 高斯溅射技术
- 基于叠加DMRS与数据传输的最优功率分配及AI接收机设计
- 面向大规模与高阶MIMO检测的“学习转换”(Learning-to-Transition)框架
MIMO信道估计
MIP*=RE
MITRE ATT&CK
MLIR
MLLM
- 学习预测 MLLM 中的中间层注意力以实现视觉 Token 剪枝
- RoRA:面向多模态大语言模型视觉token剪枝的面向角色区域分配方法
- UMER:通过面向对感知的判别推理统一通用多模态检索的嵌入与排序
- 深陷文本负债:面向MLLM智能体的视觉证据保留上下文剪枝方法
- 位置即全部:基于MLLM指代表达式分割的免费午餐式Token压缩策略
- ECOKV:通过互补多样性度量实现几何感知的 KV 缓存淘汰
MLLM优化
MLP
MLP层
MLX
MLflow
MOOSE
MVCC
MXene
Magpie TTS
Maia 200
Mamba
Mamba-2
Managed Compute
MapLibre
MapReduce
Markdown
Mastodon
Matryoshka表示
Maxis
MedGemma
MedSAM3
Medical Imaging
Memory Eviction
Meta
- Meta:推出 Muse Code 与 Muse Spark 1.2
- Meta 如何确保部署安全性:持续变更安全性的健康检查机制
- Meta 推出 ZGateway:统一 ZippyDB 流量、每秒处理超 10 亿次请求的无状态代理层
Metal
Microsoft Foundry
MiniZinc
Mixture of Experts
Mixture-of-Experts
- 稀疏混合专家模型中共享路由几何结构与动态的证据
- 负载均衡走向极端:过度离散混合专家模型中的专家剪枝专家洞察
- 在细粒度混合专家模型中免训练将激活专家减半
- 路由器先验偏置:在 MoE 后训练中保持基础路由结构
MoE
- 使用 NVIDIA NeMo AutoModel 加速 Transformer 微调
- TEMPO:面向内存与计算受限场景的专家并行负载均衡调度器
- MAPLE:MoE 自适应即插即用层级专家分配框架
- 混合专家(MoE)模块包含强有力的幻觉检测信号
- SAEM:用于思维链推理中内存高效 MoE 推理的阶段感知专家管理
- 学会选择而非重新学习:基于硬路由推理 LoRA 混合模型
- ACE:基于MoE的大语言模型自适应免校准专家跳过技术
- ACE:MoE大语言模型参数高效微调的跨专家适配器合并
- 扩展 Raschka 的 GPT-2:在 RTX 3090 上从头训练专家混合(MoE)模型
MoE 路由
MoE模型
Model Acceleration
Model Context Protocol
Modelica
ModernBERT
- Granite Embedding Multilingual R2:开源 Apache 2.0 多语言嵌入模型,支持 32K 上下文——百兆参数以下最佳检索质量
- Linkup 发布 SPARSEUP:仅 149M 参数的开源最强稀疏嵌入模型
Multi-Agent Systems
Multigres
Multimodal
Muon
Muon优化器
Muse Code
Muse Spark
NASA
NAVER AI Lab
NISQ
NL-to-SQL
NL2SQL
NLEquiv-150
NLP
NPO
NP完全问题
NSLoRA
NTP
NVFP4
NVIDIA
- NVIDIA Cosmos-H-Dreams:将实时生成式模拟引入手术机器人
- 使用 NVIDIA NeMo AutoModel 加速 Transformer 微调
- 使用 NVIDIA NeMo Retriever、托管 NIM、LanceDB、重排及基础生成构建多模态 RAG 管道
- 构建低延迟多语言语音智能体:NVIDIA Magpie TTS 带来开源权重与全面部署控制
- 企业级AI安全指南:面向开发者的NeMo Guardrails实践教程
- KernelArc:面向GPU内核优化的多智能体框架
- 深入探秘 NVIDIA cuDNN Graph API:基于 Frontend 的算子融合、自动调优与计划复用
NVIDIA A100
NVIDIA OSMO
NV色心
NZXT
NanoEQL
NeMo
NeMo Guardrails
NeMo Retriever
Nemotron
Netflix
NeurIPS
NumPy
Nunchaku
Nyström方法
O*NET
O-RADS
O-RAN
OAttention
OCGQuant
OCR
- PaddleOCR 3.5:使用 Transformers 后端运行 OCR 与文档解析任务
- 针对深度 OCR 系统的对抗性攻击
- OmniHandwritingOCR:用于评估多模态大语言模型手写OCR场景的诊断性基准
- MedStruct-S:面向OCR临床报告的键发现、键条件问答与半结构化提取基准
- 使用 deepDoctection 构建端到端文档智能流水线
- 如何从 PDF 的图表和表格中提取真正的价值
- 视觉语言模型是在阅读还是在重写?探究视觉语言模型中的转写忠实度
- 合成数据能将泰语 OCR 推向多远?
OEIS
OEIS Open
OFDM
OODA循环
OR-Agent
OSReward
OWL 2 DL
OWL 2 EL
Omega-正则目标
Omni RAG
OmniDocBench
OmniGen
OmniLens
OpWeave
OpenEnv
OpenEuroLLM
OpenForgeRL
OpenIE
OpenNMC
OpenTelemetry
- Supabase Storage:性能、安全性与可靠性的重大更新
- OpenTelemetry 进展受阻:一场关于稳定性、规模与维护者的危机
- 开放数据标准:Postgres、OTel 与 Iceberg
OpenVINO
OptiDSL
P&ID自动化
P-Bench
P-完全性
P3Bench
PAM
PCB设计
PDDL
PDF解析
PDF语料库
PEFT
- 超越LoRA:你能打败最流行的微调技术吗?
- LoCA:视觉基础模型的空间感知低秩卷积自适应
- 谱奇异值揭示了Transformer注意力机制中占主导地位的学习结构
- 开源权重模型的行为重编程:认知可塑性与对齐边界
- TaRA:感知训练过程的低阶适应初始化方法
- ACE:MoE大语言模型参数高效微调的跨专家适配器合并
PGlite
- 使用 PGlite 和 Transformers.js 在浏览器中实现语义 AI 搜索
- database.build(前身 postgres.new):配备 AI 交互界面的浏览器端 Postgres 数据库
PHMForge
PHP
PIC
PISA
POMDP
- 通过部分可观测随机博弈求解带有Omega正则目标的鲁棒POMDP
- 通过部分可观测随机博弈求解具有 Omega-正则目标的鲁棒 POMDP
- 高维POMDP的可扩展Rao-Blackwellized在线规划
POSIX
PPA优化
PPG信号
PPO
PRISM
PROCTOR框架
PROSA/ROCQ
PTQ
PTX
PTXBench
Package Manager
Packfile
Packomania
PaddleOCR
Paged Attention
PagedAttention
Papers with Code
Perplexity
- Perplexity开源Lily:专为Apple Silicon上Qwen3.6-35B-A3B打造的Rust + Metal推理引擎
- Perplexity 详解其 GPU 嵌入技术栈:Ivy、Tulip 和 ROSE 如何支撑 pplx-embed
PhysElite
PlanBench
Podman
Polkit
Poly-Encoders
PolyMath
PostGIS
PostgREST
PostgreSQL
- 何时选择只读副本(Read Replicas)与更大计算资源(Bigger Compute)
- 使用 Postgres 构建个性化 AI 助手
- 在没有超级用户权限的情况下使用 PostgreSQL 事件触发器
- 使用 Postgres 外表封装器 (FDW) 实现日历集成
- 将 Postgres 用作图数据库:巧妙(或超常)运用 pgRouting
- pgvector v0.7.0 的新特性解析
- PostgREST 聚合函数使用指南
- 在 Postgres 中使用 Wasm 外部数据包装器(Foreign Data Wrappers)
- PostgreSQL 表膨胀最小化指南
- Postgres 角色与权限管理指南
- 使用范围列(Range Columns)简化基于时间的查询
- post-graph-rag:原生于 PostgreSQL 的图 RAG 引擎
- Zeta-Lite:面向智能体记忆的并发、可分支浏览器内 SQL 数据库
Postgres
- Multigres v0.1 Alpha:Postgres 的操作系统
- 为 Postgres 外部数据包装器(FDW)添加异步流式传输支持
- Supabase 2025 年度安全回顾
- 开放数据标准:Postgres、OTel 与 Iceberg
- Postgres 中的自动向量嵌入
- 使用 DBOS 在 Postgres 中运行持久化工作流
- Postgres 语言服务器:初始版本正式发布
- database.build(前身 postgres.new):配备 AI 交互界面的浏览器端 Postgres 数据库
Pretraining
PrismML
Profiler
Prometheus
Prompt Echoing
Pufibara
PyTorch
- PyTorch 性能剖析(第三篇):注意力机制(Attention)全解析
- PaddleOCR 3.5:使用 Transformers 后端运行 OCR 与文档解析任务
- PyTorch 性能分析(第二部分):从 nn.Linear 到融合 MLP
- PyTorch 性能剖析(第一篇):
torch.profiler新手入门指南 - The Architect:在 Microsoft Excel 中交互式可视化深度学习数学原理
- 可解释架构的图形化设计
- 迈向预测性流程挖掘的可复现性:SPICE —— 一个深度学习库
- 扩展 Raschka 的 GPT-2:在 RTX 3090 上从头训练专家混合(MoE)模型
Pythia
Python
- 结合AI、开源工具与人工介入:实现
huggingface_hub的每周迭代发布 - cos(200!) 的计算奥秘:为什么大数的三角函数需要高精度算术
- 如何错误地计算余弦值
- 零知识证明浅析
- 一种简单的归约区间方法
- 轨道倾角带来的差异
- 企业级AI安全指南:面向开发者的NeMo Guardrails实践教程
- Python 邮件解析中的字节与 Unicode 混淆问题剖析
- 名字也能伤人:定位本地编码大语言模型中因包名幻觉引发的投毒抢注风险
- 计算矩阵秩的下界
Python内核
Python评分函数
Q-CARE
Q-learning
QAH
QHAdamW
QKV
QLoRA
- 从手册到维护:微调 MedGemma 以支持低资源环境下的多模态影像系统
- 迈向高效的科技情报多模态多语言观点提取:基于 QLoRA 的微调方法
- 从文档到推理:面向金融数值推理的验证型合成数据流水线与语义感知微调
QUBO
Qiskit
Quantization-Aware Training
Qwen
Qwen-2.5-VL
Qwen-VL
Qwen2-Audio
Qwen2.5
- 通过SLM与边缘计算增强虚拟智能体:思考与记忆过程的探索性评估
- SignalReasoner:评估3B模型在信号数学推理中的性能上限
- pro-team 在 LLMs4OL 2026 的表现:用于本体学习的检索增强生成与词汇约束过滤
- 蒸馏视觉语言模型以实现端侧火灾理解
Qwen2.5-VL
Qwen3
Qwen3-27B
Qwen3.8
Qwen3.8-Flash-Next
Q学习
RAG
- TS-RAG:用于时间序列预测的检索增强生成
- 超越 Top-K:用可解释的智能体操作替代黑盒检索
- 使用 Sentence Transformers 构建多模态嵌入与重排模型
- Granite Embedding Multilingual R2:开源 Apache 2.0 多语言嵌入模型,支持 32K 上下文——百兆参数以下最佳检索质量
- 使用 NVIDIA NeMo Retriever、托管 NIM、LanceDB、重排及基础生成构建多模态 RAG 管道
- INTRYGUE:基于归纳感知的熵门控机制实现可靠的RAG不确定性估计
- 被遗忘的历史还是经受住时间考验?从信息检索视角看 RAG 的回顾与展望
- 理论指导下的欺骗检测:基于 RAG 的人工智能探索
- 基于RAG的工业现场总线设备自动配置
- EnterpriseRAG:基准测试大模型在非理想企业检索条件下的指令遵循与鲁棒性
- LakeQuest:跨数据湖基础问答的三域基准测试
- LinkedIn的自进化智能客服系统
- 通过向外部大语言模型隐匿敏感信息实现保护隐私的检索增强生成(RAG)
- AaLLM:使用大语言模型实现从拓扑生成到尺寸优化的端到端模拟电路设计框架
- 法律检索增强生成(RAG)系统的幻觉问题究竟有多严重?
- 多轮大模型推理的自适应停止策略
- GRIP:基于信息受限前提的扎实推理
- 意图驱动的动态分块:基于预测信息需求的文档切分方法
- CoAL-RAG:一种兼顾复杂度感知的法律检索增强生成方法
- 使用 deepDoctection 构建端到端文档智能流水线
- 检索失效于开始之前:智能体记忆中作为保持失败的结构性间接前置条件驱逐
- RAG 亟需建立索引:为什么写入时编译优于查询时解释
- SENTRY:面向IT变更管理的确定性智能风险评估
- 基于边缘计算的代理式检索增强生成技术:用于联邦公路管理局(FHWA)桥梁检测合规性
- 真实软件历史中的时间有效性:基于GitHub修复消除代码助手记忆中的陈旧事实错误
- SchemaRouter:面向高效异构智能体 RAG 的字段感知工具路由
- 语义压缩树:通过分层语义残差实现多分辨率知识检索
- MEMONDEMAND:面向大规模企业数据的内存管理系统
- 多智能体金融顾问中的检索增强生成与确定性税务计算:一项 2x2 析因实验
- MetaRAG:面向智能体RAG的信念-动作对齐策略优化
- 土耳其语RAG系统中分块与嵌入策略的对比研究
- 用于编排异构语音和文本检索器的重排器
- 关于作用域分类与当前知识编辑基准的负面结果:以INLAY作为无梯度案例研究
- 为什么RAG会产生幻觉:引入“知识缺口金丝雀”的检索增强生成系统惩罚感知评估
- 答前先知:解码语言模型以实现可靠的RAG
- 超越置信度:通过检索扎根实现多信任搜索智能体的测试时扩展
- 土耳其语 RAG 系统分块与嵌入策略的对比研究
- 如何从 PDF 的图表和表格中提取真正的价值
- ISO-RAG:用于检索增强生成等周噪声控制方法
- 结合知识图谱扩展、RRF融合与分块扎根评估的企业文档搜索混合检索增强生成技术
- 超越RAG:实时对话中的问题识别与答案生成
- STAIR (结构感知信息检索器):用于文档结构增强的新型数据集与大模型检索器
- 你的智能体记忆能经受住模型升级的考验吗?记忆可移植性的对照研究
- 智能体上下文破解:通过非结构化数据的自适应构建实现Token高效的数据推理智能体
- 超越单次扩展:面向多跳检索的对比证据探索
- 面向目标导向对话编排的可审计符号-RAG-生成式AI架构
- PACE:面向 QoE 高效的检索增强对话服务的感知延迟自适应级联服务路由与填充词控制
- VikingRAG:面向结构化文档的高精度与高 Token 效率检索增强生成
RAG安全
RAG评估
RCTA
RDF
RDMA
REIN
REMI框架
RFC 9421
RGB-D
RGB-D融合
RISC-V
RLS
RLVR
- 提升多模态 RLVR 的泛化鲁棒性
- 提升多模态 RLVR 的泛化鲁棒性
- 基于可验证奖励的同策略蒸馏 (OPDVR)
- F-GRPO:别让你的策略只学显而易见的常识,而遗忘那些稀缺的解
- 在模型动摇处分叉:面向树状结构强化学习的信念转移分支策略
RMT
ROS2
RRF融合
RTL生成
RUPA
RWKV-7
Rao-Blackwellized
Raspberry Pi
Ratchet框架
ReLU网络
Reachy Mini
React Native
Read the Docs
Realtime
RecKAN
RecSys
ReflexBench
ReflexVLA
RefusalGuard
Reinforcement Learning
RepoProbe
ResNet
Reward Modeling
RoRA
Rocq
Roofline模型
Root Cause Analysis
Rosetta
Rothermel模型
Rowhammer
Ruby
RuleShift-Bench
RuntimeGuard-AI
Rust
- 为 Postgres 外部数据包装器(FDW)添加异步流式传输支持
- Postgres 语言服务器:初始版本正式发布
- 在 Postgres 中使用 Wasm 外部数据包装器(Foreign Data Wrappers)
- 并发服务器:第 7 部分 - Rust 语言实现
- 基于静态分析引导的智能体 AI 翻译:使 Rust 成为全栈生物信息学语言
- 训练强化学习模型玩转 Bonk.io
- 快节奏与硬核代码
- Perplexity开源Lily:专为Apple Silicon上Qwen3.6-35B-A3B打造的Rust + Metal推理引擎
- 耗时一年:WebAssembly 终于登陆 Anubis
- 如何精准捕获代码缺陷:基于 Rust 正则引擎的高效模糊测试实战
R语言
S3
SA-PPG
SAFE框架
SAGE-Fin
SAM
SARS-CoV-2
SCPI
SE(3)李群
SEC备案
SFT
SGLang
SHACL
- 从样例中学习形状:递归 SHACL 中形状学习的基础
- PolicyKG:将机构政策转化为 SHACL 知识图谱的智能体 LLM 流水线
- NL2SHACL-Bench:自然语言转SHACL翻译的基准测试套件
SHAP
- SIGMA:面向无元数据 LLM 自动特征工程的 SHAP 引导隐式轨迹生成
- 见证者解释异常:WAND——具备原生可解释性的无监督表格异常检测器
- 价格与交易动态的可解释深度学习:从黑箱预测到高效参数化模型
SHAP解释
SHELF
SIGNBALANCE
SKILL.md
SLIFT
SMT
SMT求解器
SMU
SO(3)-等变性
SOC
SPARSEUP
SPD流形
SPD矩阵
SPS
SQL
- InferQ:面向量子电路模拟的数据库基准测试
- Supabase 推出支持 Iceberg 的分析存储桶(Analytics Buckets)
- Postgres 语言服务器:初始版本正式发布
- 从 SQL 生成到工具选择:一种面向领域的 MCP 服务器模式
- 关系核心图分析:以SQL规模查询图数据,以及为什么节点/边模型是性能税而非连接数据的真实写照
SQLite
SQL优化
SQL生成
SRPO
SSA
SSH
SSI
STAR项目
STeReO
SUMO
SVDQuant
SVG
SVG生成
SWE Agent
SWE-Bench
SWE-Gate
SWE-bench
- 孟德尔哥德尔机:通过比较进化实现递归自我改进的编码智能体
- FailForge:从持续失败中为代码智能体提炼程序性能力
- Kozuchi Agent:用于软件修复的语言无关开源权重智能体
- LEGO-RL:面向代码智能体的原生基架强化学习
- 编码代理的工作集:代码库规模任务中的一致性债务
- RealSWE:真实用户请求下编码智能体的组合式评估
SWRL
SafeDivertor
Scaling Laws
SciUnlearn
SearchTome
Sentence Transformers
- 使用 Sentence Transformers 构建多模态嵌入与重排模型
- 使用 Sentence Transformers 训练和微调多模态嵌入与重排模型
- 使用 Sentence Transformers 构建多向量(后期交互)嵌入模型
Set Transformer
ShapeGen3DCP
Shapley值
SigV4
SightSense
Sigma规则
Sigmoid Attention
SignLlama
Sim2Real
Sionna RT
SkillForge
SkillsBench
SmartNIC
Social Interaction
Softmax注意力
Solidity
SonarBench
SonarLLM
Sparse Autoencoders
Spec-Driven Development
SpeechGym
Stable Audio Open
StateM
StateSight
Steam Deck
Storage
Strands Agents
Supabase
- 何时选择只读副本(Read Replicas)与更大计算资源(Bigger Compute)
- Supabase Storage:性能、安全性与可靠性的重大更新
- Supabase 2025 年度安全回顾
- 安全使用 Supabase MCP 与大语言模型:防范提示词注入与深度防御指南
- 使用 Supabase Edge Functions 和 mcp-use 构建 ChatGPT 应用
- 使用 Edge Functions、Cron 和队列处理大规模任务
- 使用 Postgres 构建个性化 AI 助手
- 在没有超级用户权限的情况下使用 PostgreSQL 事件触发器
- Supabase 推出支持 Iceberg 的分析存储桶(Analytics Buckets)
- Postgres 中的自动向量嵌入
- Data API 路由至最近的只读副本
- 使用 DBOS 在 Postgres 中运行持久化工作流
- 使用 Postgres 外表封装器 (FDW) 实现日历集成
- Supabase CLI v2:实现配置即代码 (Config as Code)
- Supabase Edge Functions 重磅更新:引入后台任务、临时存储与 WebSocket 支持
- 使用 Supabase、Flutter 和 Brick 构建离线优先的移动端应用
- 使用 Expo 和 Legend-State 构建本地优先的实时应用
- Supabase Realtime:广播与在线状态的授权机制
- 使用 PostGIS 生成矢量瓦片
- 在 Postgres 中使用 Wasm 外部数据包装器(Foreign Data Wrappers)
Supabase Wrappers
Swarm Testing
Syncthing
SynthID
Systemd
- 当文件系统卸载时如何停止 Systemd 服务
- 为什么我们的某个系统遇到了极慢的 systemd 会话启动问题
- Systemd 用户服务单元与特殊 Shell 带来的意外挑战
- 我们不再使用 Linux 的严格内存超售模式
T1
TCP
TCT框架
TEPA
TOP-Align
TPU
TRL
- 使用 Hugging Face Bucket 传输万亿参数:TRL 中的 Delta 权重同步机制
- 通过 100 步 GRPO 微调 350M 模型以获得更好的结构化输出
- 使用 TRL 与 OpenEnv 训练会用代码画水彩画的代码模型
TRUSS
Task-Adaptive
TensorCore
Terminal-Bench 2.1
Terminal-Universe
Text-to-SQL
Theory of Mind
Three.js
TigerStyle
Tigris
TimeCatch
TinyML
Token Pruning
Tokenization
Token优化
- 考虑使用 ACE?我们能用更少的 Token 实现它
- 多智能体AI工作流中的Token优化与上下文窗口管理
- 少读多解:面向AI智能体的Token高效稀疏阅读技术
- 一张表格价值64个Token:多表格文档问答的像素级压缩
- String:一个让每个应用皆为 Markdown 文件的智能体操作系统
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- 智能体上下文破解:通过非结构化数据的自适应构建实现Token高效的数据推理智能体
Token剪枝
Token压缩
- 面向长文本自动驾驶的规划对齐 Token 压缩
- 位置即全部:基于MLLM指代表达式分割的免费午餐式Token压缩策略
- 位置即全部:基于多模态大语言模型的指代表达式分割免训练Token压缩策略
- FastSLM:用于高效长语音自适应的分层时间抽象架构
- FastE:基于读出触发的 LLM 嵌入推理 Token 压缩算法
Token效率
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- 语言服务器能为编程智能体节省Token吗?测量方法与初步研究
- LOCUS:面向高 Token 效率语言生成的任务感知低秩训练后优化
- VikingRAG:面向结构化文档的高精度与高 Token 效率检索增强生成
Token消耗
Token级别分配
Token裁剪
Token通胀
Token预算
Tokio
Tool-use
Top-k
Top-k 选择
Touch ID
Trajectory Modeling
Transformer
- TS-RAG:用于时间序列预测的检索增强生成
- MACRO:Transformer 层的马尔可夫链路由
- 超越序列顺序:Transformer 的句法感知位置编码
- 短上下文语言建模中的逐层位置偏差
- PyTorch 性能剖析(第三篇):注意力机制(Attention)全解析
- bioMoR:用于高效基因组学习的生物学引导递归混合模型
- Muon 训练 Transformer 中的表征-读出接口后突悟崩塌现象
- TransSLR:用于手语识别的轻量级 Transformer
- Fluid-DiT:用于流体流动模拟学习的无图扩散Transformer
- 跨资源区间的依存句法分析:评估高资源与低资源语言上的架构性能
- 谱奇异值揭示了Transformer注意力机制中占主导地位的学习结构
- MOON:多任务学习的多目标正交归一化更新
- 可解释计算机视觉中的类激活映射:CNN、Transformer与基础模型时代视觉解释的方法论中心综述
- 深度活动模型:用于人类出行模式合成的生成式方法
- 双流Transformer:将主预填充路径与额外的解码计算解耦
- 训练混合:将小规模支架式预训练运行重新组合为更大的语言模型
- Transformer长度泛化的代数分解理论
- Transformer 需要三个投影吗?QKV 变体的系统性研究
- SAGE:基于注意力引导熵的脉冲Transformer替代梯度自适应方法
- 基于叠加DMRS与数据传输的最优功率分配及AI接收机设计
- RecipeNet:面向配方数据的分层 Transformer 架构
- 面向大规模与高阶MIMO检测的“学习转换”(Learning-to-Transition)框架
- 自组织数字电路
- ArGEnT:用于算子学习的任意几何编码 Transformer
- 你的注意力指标究竟在回答哪个问题?作为成分数据的注意力行
- DMT-Dens:面向生物学数据的密度保持流形可视化
- 从注意力掩码到惯性零向量标记:OAttention 与 O-Closure 标记动力学
- BF1:面向高效长文本 Transformer 的因果二元稀疏注意力改造方案
- KVBoost:基于偏差引导重计算的块级键值缓存重用技术,助力高效大模型推理
- 让信用跟随计算:面向大语言模型强化学习的架构感知信用传递
- 可缩放矢量图形的潜在空间
- Sigmoid Attention:构建学习型 KV 缓存淘汰的更优底层架构
- 通过CT阅片过程中的3D注视模式预测放射科医生的专业水平
- ATLAS:在一小时内自动化近似 Transformer 以实现高效同态推理
- CoFrGeNet:面向语言生成的连分数架构
- 更具表达力的前馈层:第一部分. 激活函数的Token自适应混合
- 离散对数时钟:Transformer 如何学习模乘法
- 通过 Transformer 变分自编码器学习稀疏决策树
- Transformer的拓扑困境
- 基于能量的 Transformer 作为阅读难度预测指标
- 雅可比视角下的循环Transformer:全局工作空间能在循环中幸存吗?
- Nova:面向深度学习的端到端 MLIR 编译器
- 给它空间!编码器中位置与语义表示的显式解耦
- TraveL:基于Transformer的多视角路径分布表示学习
- IPGeoAI:基于Transformer与大语言模型语义融合的IP地理定位技术
- 面向多站点工业预测性维护的长程Transformer分位数故障预测
- 面向视觉与语言Transformer的感知损伤多臂老虎机剪枝技术
- 早期编码、后期调用:Transformer在何时开始依据推断出的伙伴专业性采取行动
- 几乎零开销的状态-预测解耦架构
Transformers
- vLLM 原生速度 Transformers 模型后端
- 使用 NVIDIA NeMo AutoModel 加速 Transformer 微调
- 它够具智能体特性吗?在自有工具上对开源模型进行基准测试
- PaddleOCR 3.5:使用 Transformers 后端运行 OCR 与文档解析任务
- 您自己本来也想提的 Pull Request:用代码智能体加速 MLX 语言模型移植
- Transformer 难以利用其涌现的世界模型:重探河内塔与思考的错觉
- 句法与语义:Transformer如何学习深层依赖
Transformers.js
- 在 Transformers.js 中体验提议中的跨域存储 API
- 如何在 Chrome 扩展程序中使用 Transformers.js
- 使用 PGlite 和 Transformers.js 在浏览器中实现语义 AI 搜索
Transformer加速
Transpiler
Triton
Triton优化
TypeScript
- 规范优先的AI编码智能体收敛实践:在无测试预言机、无人工代码审查的情况下,对71.7万行代码库中189个文件的核心架构不变式进行拆解的案例研究
- Vercel 开源 vgpu:面向 AI 智能体着色器的 TypeScript WebGPU 库
UAI 2026
UAV
UI组件
UI转代码
UPS
Ubiquiti
Ubuntu
UltraQuant
Uncertainty Quantification
UniFi
UniTraffic-Agent
Unicode
Unix
VLA模型
- LeRobot v0.6.0:想象、评估、改进
- WAM-Diff2:用于高效率自动驾驶VLA的分层自回归到扩散蒸馏
- Reflex:为反应关键型操作打造快速且具预测性的视觉-语言-动作模型
- AtomBridge:面向科学实验长程任务的智能体化 VLA 推理插件
- 面向混合架构的视觉-语言-动作模型高效块级并行推理
- 视觉-语言-动作模型的比特翻转攻击:动作解码架构决定漏洞脆弱性
- 带着意图行动:为视觉-语言-动作模型蒸馏行为意图
- REFACTOR-VLA:类型化运动程序的无监督库学习
VLM
VLM推理加速
VQ-Bench
VQ-VAE
VQ-bench
VTC-Bench
Vacuum
Vamana
Vercel
Verilog
ViT
VibeWorlding
VikingRAG
Vision Transformer
Vision-Language Models
Volve油田
WGS84
Weaviate
WebAI
WebAssembly
- 使用 Postgres 外表封装器 (FDW) 实现日历集成
- database.build(前身 postgres.new):配备 AI 交互界面的浏览器端 Postgres 数据库
- 在 Postgres 中使用 Wasm 外部数据包装器(Foreign Data Wrappers)
- Zeta-Lite:面向智能体记忆的并发、可分支浏览器内 SQL 数据库
- 耗时一年:WebAssembly 终于登陆 Anubis
WebGPU
- 如何在 Chrome 扩展程序中使用 Transformers.js
- Vercel 开源 vgpu:面向 AI 智能体着色器的 TypeScript WebGPU 库
- 介绍 @huggingface/kernels:面向本地 AI 的 200 多个 WebGPU 核函数
WebRider
WebSocket
WebVoyager
WebWorkers
Webhook
Whisper
Will Wright
WinRT
Windows
WitCert
XAI
XGBoost
YAML
Z.ai
ZGateway
ZJIT
Zig
ZipCal
ZippyDB
Zsh
arXiv
- 大语言模型中思维链推理的平均场动力学
- 测出的AI偏好中,模型占几何,测量工具又占几何?
- 使用经过验证的任务覆盖率评估大语言模型的多次生成能力
- 12个CNOT的双量子比特激发门
- 负载均衡走向极端:过度离散混合专家模型中的专家剪枝专家洞察
- GPTNT:基于《保持通话和炸弹不炸》的多模态智能体实时协作基准
cgroups
cuDNN
debian
deepDoctection
do-算子
eBPF
funes
golang
homelab
iEEG
iOS开发
llama.cpp
loginctl
mHC
mKernel
mRNA语言模型
macOS
mmWave
monday.com
nGPT
nuScenes
openPangu
optimization
performance
pgRouting
pgvector
- 使用 Postgres 构建个性化 AI 助手
- Postgres 中的自动向量嵌入
- 使用 PGlite 和 Transformers.js 在浏览器中实现语义 AI 搜索
- pgvector v0.7.0 的新特性解析
- post-graph-rag:原生于 PostgreSQL 的图 RAG 引擎
pyAgrum
robots.txt
simd
systemd
terms.txt
vLLM
- vLLM 原生速度 Transformers 模型后端
- 使用 Hugging Face Bucket 传输万亿参数:TRL 中的 Delta 权重同步机制
- vLLM V0 到 V1 迁移:在强化学习中纠正偏差前,先确保后端正确性
- vToken:面向可回收 KV 缓存的Token级虚拟化技术
- 基于 LoRA 与 HF Jobs 的异步 GRPO 训练:对象存储、代理与零 NCCL 实践
visitation measure
zk-SNARK
zk-SNARKs
Кан扩展
一元二阶逻辑
一致性债务
一致性协议
一阶逻辑
三值化
三值大模型
三值量化
三维重建
三角不等式
三角函数
上下文偏置
上下文剪枝
上下文压缩
上下文多臂老虎机
上下文学习
- 基于上下文学习预测漏洞严重性:一项工业级案例研究
- Xiaomi-TabLDM:表格基础模型技术报告
- 当用户不再主动提问:对话式智能体中上下文驱动记忆检索的基准评测
- 通过贝叶斯视角统一 ICL、SFT 与 KL 正则化强化学习
上下文对齐
上下文工程
上下文强化学习
上下文强盗机
上下文持久性
上下文无关文法
上下文概率
上下文窗口
上下文管理
- 编码代理的工作集:代码库规模任务中的一致性债务
- 上下文即环境:面向长程智能体的程序化上下文管理
- 长运行 AI 智能体内存中的“压缩悬崖”现象
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- 面向语音大模型服务的可扩展上下文编排
上下文融合
上下文表示
下推自动机
不变核心
不可判定性
不完全信息博弈
不完美信息博弈
不对称时间算子
不确定性估计
- 流匹配不确定性的几何学:零成本不确定性代理及其在基于流的VLA故障检测中的应用
- INTRYGUE:基于归纳感知的熵门控机制实现可靠的RAG不确定性估计
- CLAIM:基于不确定性度量的大语言模型开放域主动澄清框架
- ELVAE:基于证据学习的变分自编码器用于不确定性感知的生成
- 目标感知的校准数据选择:在量化语言模型中保持不确定性
- 面向黑盒大模型分类推理的层级感知监督不确定性估计
不确定性处理
不确定性感知
不确定性推理
不确定性管理
不确定性量化
- 面向模块化大模型安全代理的事后轨迹风险认证
- 基于可微分D-vine Copula的局部化异常检测
- KReF:用于长期时间序列预测与预测不确定性的免训练检索框架
- 两步式 MV-DeepONet:由随机输入场驱动的不确定性传播概率算子学习
- 超越单轮置信度:LLM 智能体的轨迹自适应不确定性量化
- 当AI重写,分类器放松:针对讽刺与AI释义社交文本的不确定性感知的正面/负面情绪分析
- 等变协方差张量:张量值几何学习中具有SPD保证的不确定性
- 监督式不确定性量化集成何时能提升大模型幻觉检测能力?一项鲁棒性研究
- 神经算子的保角不确定性量化保证
- CUSP:多智能体多模态推理的可分解集体不确定性
- ActMap:基于生成期激活特征图的单次推理不确定性量化
专家分配
专家剪枝
专家并行
专家模型
专家混合模型
专家管理
专家语料
专家调查
专家跳过
专家迭代
世界价值观调查
世界模型
- EnvACE:通过世界彩排将环境动力学内化用于智能体强化学习
- LeRobot v0.6.0:想象、评估、改进
- CosmosAlign:适配世界基础模型以实现生成式交通视频预测
- 从世界模型到世界行动模型:机器人学简明教程
- FACT:世界-动作模型的故障感知因果训练
- 目标函数才是瓶颈:潜在世界模型编码了其规划器无法使用的信息
- 被动物体状态世界模型中运动学、接触及物体恒存场的事件条件诊断
- 低秩动力学有效潜在载体:用于学习世界模型中反事实推演的方法
- 结合世界模型的Q学习 (Q-Learning With World Models)
- 无需高斯假设:面向 JEPA 世界模型的对比逆动力学
- BRo-JEPA:在潜空间中学习模块化变换
- 划分支撑集,重建残差:面向视频生成与世界模型的免训练稀疏注意力机制
- 环境、智能体及联合智能体-环境系统的世界模型
- CIVA:针对视觉世界模型智能体的评论者诱导价值子空间攻击
- DECOWAM:面向四足移动操作的解耦式全身世界-动作模型
- 从生成到模拟:世界模型距离真正的模拟器还有多远?
- 纠正学到的物理不变量可改善世界模型的前瞻推演
- 面向高弹性空间机器人的无奖励持续自适应
- 解耦规划与控制:面向可指令智能体的 Instruct-to-Act 系统
- 解耦可指令智能体的规划与控制
- 编码智能体是否需要可执行世界模型、简化和验证来解决 ARC-AGI-3?
- WM-R1:通过强化学习训练具备推理与世界模型利用能力的GUI智能体
- 联合嵌入预测世界模型在物理规划中取得成功的关键驱动因素是什么?
- 重新审视面向安全关键具身系统的世界模型
- 语义贝叶斯世界模型
- 迈向面向目标条件化机器人规划的物理基础 JEPA 世界模型
- CoMAP:用于大语言模型智能体的世界模型与智能体策略共同演化框架
- 在Atari Pong中改进强大智能体背后的弱世界模型
- ARC-Bench:闭环重规划掩盖了冻结 JEPA 世界模型中失效的动作排序
- 学习用于部分可观测性下具身推理的反事实世界模型
世界行动模型
业务场景
业务流程管理
丢番图逼近
两轮车安全
严格标准化平均差
个人AI基础设施
个人助理
个体语言特征
个性化
个性化AI
个性化健康管理
个性化基准测试
个性化学习
个性化教育
个性化智能体
中智偏见指数
中间件
串口通信
临床AI
临床交互
临床决策
临床决策支持
- 从连续预测变量到临床阈值:基于指南的分类法在缺血性卒中预后预测中的性能权衡研究
- ETHOS:面向临床多智能体系统的模块化伦理框架
- 从超声报告提升 O-RADS 风险分层:混合推理与端到端大模型推理策略的比较评估
- Clinical Graph-JEPA:用于认知决策支持的预测性患者状态知识图谱
临床应用
临床心理学
临床推理
临床督导
临床评估
临床诊断
临床试验编程
临床部署
临床预测
临床风险预测
临床验证
丹麦语
主动学习
主动式智能体
主动技能学习
主动推断
主动澄清
主动诊断
主成分分析
主观任务
乌克兰语
书目学
乳腺癌
事件序列
事件相机
事件计数
事件预测
事务安全
事实性
事实核查
- PatchWrite:一行而非一节——面向AI撰写文稿的编译门控与有效性保持编辑框架
- 审视合成回忆录:对照真实生活记录评估大模型生成自传中的场景级胡言乱语
- ProvenanceGuard:基于模型上下文协议(MCP)的大模型智能体源感知事实核查机制
事实监督
二值量化
二元决策图
二分图
二进制逆向
二阶优化
二阶方法
云原生
云计算
云边端计算
互操作性
互补推荐
亚马逊
亚高斯性
交互作用分析
交互就绪性
交互式AI
交互式可视化
交互式证明
交互式评估
交互成本
交通优化
交通智能
交通模拟
交通流分配
交通流控制
交通行为建模
交通规划
交通视频
交通视频理解
人力资源科技
人工意识
人工智能
- Otter:一款具备时间感知与历史上下文的人类国际象棋 AI
- 从连续预测变量到临床阈值:基于指南的分类法在缺血性卒中预后预测中的性能权衡研究
- 随机性并非难点:先决条件有向无环图(DAG)教学序列中的归约与复杂性
- 抽象事件因果规则:归纳与应用
- 马尔可夫决策过程的属性驱动因果抽象
- AI玩商业游戏:在动态模拟中对大语言模型管理决策能力的基准测试
- EviGraph:证据引导的自主科研智能体
- 深入剖析 EvoMap:自进化智能体间协作网络的特性研究
- OlmoEarth v1.1:一个更高效的地球观测模型家族
- 成交还是拒绝:情绪在多智能体谈判中的作用
- 通过分块 SVD 寻找可用的权重机制
- 一图胜千Token:视觉语言模型如何在大幅降低AI能耗的同时提升准确率
- 交互催生独立状态下所不具备的动态AI行为
- 编程智能体的在线监控与纠偏导向
- 加速器调试算法的自主发现
- 复杂天然产物的策略优先合成规划
- AutoMOOSE:用于自主相场模拟的智能体AI
- 可信智能体网络:智能体网络中的信任必须是原生构建的,而非事后补救
- 孟德尔哥德尔机:通过比较进化实现递归自我改进的编码智能体
- 不会“跑偏”的AI科学家:四足机器人导航研究循环中的学术品味、结构化设计与可证伪发现
- 多用户冲突中的权威期望效应
- 你的提示词并非唯一的提示词:大模型对结构化输出模式描述的权重究竟有多高?
- 理论指导下的欺骗检测:基于 RAG 的人工智能探索
- 一阶证明搜索中保持结构的的不确定性传播
- 重新思考自进化智能体:我们是否仍然需要既定的优化流程?
- 智能体自主研究即模糊测试 (arXiv:2608.09855 [cs.AI])
- AI 预测集合是否采样了正确的条件分布?
- AI 辅助验证中的认知迁移:框架与评估协议
- Conway 99-图问题的强制结构归约与可验证界限
- OEIS Open:语言模型能把多少猜想变成定理?
- 结构性沉默:当AI基础设施辜负代表性不足语言的使用者
- 赋能儿童:创造人工智能驱动的增强现实体验
- 面向分层式人类动作识别的组合式基准测试综合生成
- 基于循证的科学问题发现:融合历史回测的框架
- 个性化技能能帮助编程智能体吗?开发者交互历史的实证研究
- 立场:推理是一个基于规则的可学习过程
- VALG:用于机器学习理论研究的智能体系统
- 大语言模型中的数字能力:根本局限与改进路径
- 多层上下文伪装理论:面向防作弊在线评估的语义叠加与上下文叠层框架
- 并非所有提示皆能奏效:AI辅助写日记中的行为可控性与阐述质量
- 面向格罗滕迪克常数的长周期AI研究:人机数学协作案例研究
- 自主芯片设计中的智能体编排
- Tripwire:通过统计认证的安全神经元触发对齐拒绝机制
- 分工协作:将证据解释与决策聚合解耦
- 基于叠加DMRS与数据传输的最优功率分配及AI接收机设计
- 工程化可靠的编程智能体:评估与运维模型周边的系统
- 面向格罗滕迪克常数的长周期AI数学研究:人机数学协作案例研究
- 个性化自动研究:迈向真正的 AI 共同科学家
- 超越正确性:基于 Lean 4 实现自动化新颖性验证
- CoupVisor:基于回合与质疑决策支持的策略优化
- 概率电路:人工智能中的推理机器(第一部分)
- HLSR:面向实时拥堵规避的混合实时预测选择性动态车辆重路由
- 集体反事实规划:表征约束下的协调、同意与验证
- 我们的仆人会代劳:自动化与人类工作的未来
- 衡量部分得分差距:越南2025年凸性评分方案的严格基准测试
- 是什么让软件问题解决任务对智能体来说如此困难?
- 机器上的机器科学:计算化学中的AI智能体
- AI 的十万个为什么:大语言模型的准确定性与“AI 垃圾内容”的指纹特征
- Hacker News 上有多少内容是 AI 生成的?
- 儿童的学习效率为何依然超越AI——至今仍是一个谜
- Why2Speak:拒绝行动策略的忠实推理
- VortexChat:用于自主多目标集成光子设计的智能体框架
- 一种用于智能洪水响应的时间规划方法
- 微调心电图基础模型以预测冠状动脉CT血管造影结果
- PatchWrite:一行而非一节——面向AI撰写文稿的编译门控与有效性保持编辑框架
- 人工共情:迈向无监督智能体检测与策略重构的框架
- 从生成到模拟:世界模型距离真正的模拟器还有多远?
- 当今数学是什么,未来又该走向何方?
- EarthVerse:跨动态地球系统与自然灾害的科学智能体基准测试
- 构建用于基于人工智能的连续环形撕囊术技能迁移的预测性手术路径
- 超越基准:基于拟人化与生命周期导向的大模型评估路线图
- MOSAIC:面向结构化智能体与组合的模块化编排框架
- 面向可分叉计算的证据感知 MapReduce
- 推理捷径与价值对称性:对称性所允许的、架构所实现的与优化所选择的
- 测出的AI偏好中,模型占几何,测量工具又占几何?
- 审视合成回忆录:对照真实生活记录评估大模型生成自传中的场景级胡言乱语
- 开放世界多智能体环境中的自主数学发现
- 裁判应当知道发生了什么变化:大模型作为裁判评估的构念效度
- 轴心与站点多智能体路径规划:可解性、复杂性与算法
- LUCAID:用于肺癌精准病理学的智能体多模态人工智能
- 解释的数学理论:理性熵、谱读出与作为资源的混淆性
- 分子大模型智能体:从架构设计到科学自主
- AI新方法揭示基因组模型从DNA中学习的内容并暴露出隐藏的实验偏差
- SIMGUIDE:基于程序化落地的多上下文表示法,赋能个性化智能体规划
- 联邦化几乎免费,推理则不然:蛋白质表征工作流中 AI 联合科学家的权衡
- 折扣和收益的分类自动机
- 并非所有的评估感知都生而平等:能力框架预示着合规性
- 大模型驱动的群集智能:新前沿还是概念延伸?
- NiyamAI:基于零知识证明的具备密码学可验证护栏的意图绑定型AI智能体
- SIMGUIDE:基于程序化落地的多上下文表示,赋能个性化智能体规划
- PhysElite:大模型距离解决奥赛级物理题还有多远?
- 联邦几乎零成本,推理则不然:蛋白质表征工作流中AI联合科学家的权衡
- EULER:利用经证据校验的回传机制探索多智能体数学发现中的未充分利用链接
- 摆脱冗余推理:面向推理阶段大语言模型的结构感知搜索
- 苏格拉底遭遇“核”聚变:利用脑电波传感技术对比学习场景下AI系统的交互策略
- 解析流式数据:面向长程智能体及其观察者的实时追踪模型
- 使用大语言模型与编程语言语义预测程序退出代码
- 基于推理的汽车电气/电子组件鲁棒性验证
- AI 数学家:迈向完全自动化的前沿数学研究
- AutoGraphForge:迈向图论的自动化发现
- 物理实验室的可计算表示助力可验证工作流
- Transfiver:通过共享可编辑状态实现人机协同推理
- LightEMMA:视觉语言模型自动驾驶能力的纵向评估
- K-Bench:衡量模型在真实科学智能体请求上的性能
- 潜在的力量:AI时代黑客技术的趋同与独立思考的反思
- 形式化验证费马大定理:Claude历时11天实现数学史里程碑
- PerfReasoning:大语言模型在硬件性能推理上的表现究竟如何?
- Atlas:在异构集群上优化复合人工智能工作流的部署
- GPTNT:基于《保持通话和炸弹不炸》的多模态智能体实时协作基准
- AutoFyn 技术报告:面向长视角智能体的非参数专家迭代法
- 情感目标导向理论的计算实现
- 当智能转化为能动性:共生式AI系统的受控主动能动性理论
- 量子AI会梦见路径吗?基于Grover干涉的路径积分慢思考
- 人机协同发现可重构面内铁电超畴控制
人工智能伦理
人工智能公平性
人工智能历史
人工智能安全
- 谁构建了这个模型?通过权重空间的谱指纹追踪大语言模型血缘
- 上下文不等于权限:金融市场智能体的结构化运行时治理
- 多模态大语言模型不断演进的安全格局:新兴威胁与防御综述
- 定位与控制大型语言模型中的隐式个性化
- 通过建议渠道实现的个人赋权剥夺:内生影响力下的控制权丧失
- 确认点即系统:面向AI审计证据的持久化策略决策回执
- 不完美对齐下的价值脆弱性
- 何时将苹果称为红色:人类遵循内省规则,而视觉语言模型(VLM)则不然
- 当词汇理解失效于临床推理:评估治疗型聊天机器人针对Alpha世代的安全风险
- 大语言模型能够进行内省吗?一项现实检验
- 超越Token位置:扩散语言模型中跨去噪步骤的安全对齐
- 自主研究智能体群体中涌现作弊与吹哨行为的案例研究
- 文明框架:个人多智能体系统间基于主权锚定的通信
人工智能导师
人工智能推理
人工智能教育
人工智能架构
人工智能治理
人工智能评估
人工智能问责制
人工物理世界
人工生命
人工神经网络
人工词库
人机交互
- 图灵的第一个模仿游戏:设计理念与“人类趋近机器”的全新解读
- FormBharo:为印度农村地区对话式填表而设计与评估的语音代理
- WebRider:面向实时网页辅助的个性化意图控制器
- 严肃游戏:人机交互、演化与协同演化
- 多用户冲突中的权威期望效应
- 穿梭于讨论之间:用于现场小组讨论分析的移动可视化分析系统
- 基于《成人类卡牌游戏》(Cards Against Humanity) 的跨模型幽默偏好建模
- AI 辅助验证中的认知迁移:框架与评估协议
- CLAIM:基于不确定性度量的大语言模型开放域主动澄清框架
- 赋能儿童:创造人工智能驱动的增强现实体验
- 并非所有提示皆能奏效:AI辅助写日记中的行为可控性与阐述质量
- 交互就绪性:构建与评估人类角色 AI 智能体的框架
- 代理验证的 LLM 用户体验微模拟:早期决策支持的构件优先协议
- 音乐之镜:大语言模型在词曲创作中充当共鸣板
- Chronocooked:强化学习智能体隐式区间计时基准测试
- MistyPilot:通过多智能体大模型技能编排实现社交机器人控制
- 学生与AI交互中的提问类型分析:一项针对两项CS2任务的案例研究
- UltraArUco:一种用于移动端增强现实交互的轻量级多语言低延迟实时标记追踪库与框架
- LEDGER:用于审计 LLM Agent 的声明-证据追踪图
- 身份感知的人机交互动作描述生成
- 重要他人 AI:作为长期关系智能的身份、记忆与情绪调节
- 看起来对,运行也对:多屏幕移动应用生成的项目级基准测试
- 解决可解释人工智能中的选择问题
- 基于大语言模型的虚拟人言语与非言语行为不一致性选择
- GUI元素定位中的词汇耦合:句子嵌入在移动端与Web端的标签追踪表现
- StrokeGuard:用于院前卒中评估的多智能体引导系统
- CrabOS:人机共栖操作系统
- 苏格拉底遭遇“核”聚变:利用脑电波传感技术对比学习场景下AI系统的交互策略
- 大语言模型中的“拆屋效应”请求与拒绝行为
- Transfiver:通过共享可编辑状态实现人机协同推理
- 主动式服务智能体:统一的决策框架、方法与评估
- 替我发言:赋予大语言模型参与会议的情境感知能力
- 通过人机交互实现高效测试时适应
- 保护性能力幻觉:当大语言模型声称拥有不存在的能力
人机共栖
人机协作
- 无法追责的授权、日渐衰退的技能:绘制职场AI代理的风险图谱
- 面向无人机入侵检测的对话式与仪表盘式可解释AI:操作员信任与依赖性的实证研究
- MazzikaAI:用于实时阿拉伯木卡姆即兴伴奏的基于知识的演奏到提示词编译器
- 面向格罗滕迪克常数的长周期AI研究:人机数学协作案例研究
- 面向格罗滕迪克常数的长周期AI数学研究:人机数学协作案例研究
- 概念复杂的范围综述中人工与大语言模型筛选工作流评估:召回率-工作量权衡与运行一致性
- 连接一维集体行为自发与场诱导机制的人机定理
- MOSAIC:用于跨范式智能体混合与人机协作的通用智能体级接口
人机协同
- AutoIntervene:面向动作分块模仿学习策略的校准式干预方法
- 用于医疗数据协调的双重混合语义数据湖架构:结合人机协同验证与大模型驱动的元数据标注系统
- 虚拟细胞的人机协同因果知识注入
- 先治而后连:生产级知识图谱中的身份与本体标记
- Max-Q 选择性模仿:用于人机协同在线机器人学习
- 调校随机机器:人机工程学系统工程师操作模型
- 大尺度推荐解释中“大模型即裁判”的生命周期管理
- HIRA:面向受监管行业文档分类的人机协同检索增强级联系统
- MACD:面向大语言模型的自学习知识多智能体临床诊断框架
人机对齐
人机系统
人格演变
人眼注视轨迹
人类出行
人类判断
人类动作识别
人类反馈策略迭代
人类对齐
人类活动识别
人类状态跃迁
人类移动
人类认知
人类评估
人脸识别
仇恨言论检测
仓库自动化
仓颉编程语言
代币定价
代数理论
代理工具
代理智能
代理智能体
代理模型
代理系统
代理验证
代码优化
代码修复
代码分析
代码助手
代码合成
代码复用
代码大模型
- 规范优先的AI编码智能体收敛实践:在无测试预言机、无人工代码审查的情况下,对71.7万行代码库中189个文件的核心架构不变式进行拆解的案例研究
- 当模型改动过多:论最小代码编辑的保真度
- SWE-Gate:通过功能测试对软件工程智能体而言远远不够
- CodeTD:注意力拓扑结构检测代码大语言模型中的幻觉
代码安全
代码审查
代码审计
代码库理解
代码库规模
代码意图预测
代码推理
代码智能体
- FailForge:从持续失败中为代码智能体提炼程序性能力
- QuoteBench:匹配分数如何掩盖命令路径失效
- LEGO-RL:面向代码智能体的原生基架强化学习
- 引导而非求解:为大型代码智能体训练小型评论员模型
- Terminal-Universe:将智能体轨迹转化为可扩展的终端环境
- 爬坡 SWE 智能体:1700 个编程任务教会了 Kimi K2.7 什么
代码检索
代码混淆
代码演进
代码现代化
代码理解
代码生成
- CodeGrep:面向大模型编程智能体的强化学习检索代理
- 忽视关键投票:聚合独立性指标未能揭示验证真正起作用的地方
- DiDPO:面向编程智能体训练的差分双重策略优化
- 孟德尔哥德尔机:通过比较进化实现递归自我改进的编码智能体
- P^3:用于验证代码生成的联合程序与证明规划
- 影响力策略重要吗?大语言模型代码生成中提示词框架效应的研究
- Vero:AI智能体能够构建形式化验证的软件代码库吗?
- CangjieBench:在低资源通用编程语言上评估大语言模型
- 知道何时寻求帮助:分层LLM智能体中的贝叶斯自我升级
- Quasar:专为大模型代码操作而设计的编程语言
- 使用编码智能体进行自动研究:古兰经诵读数据上的泛化者与指标最大化者
- 你的AI Agent能更省钱吗?探究任务规范对智能体编程任务中Token消耗的影响
- AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索
- 基于错误代码驱动的测试用例合成与密集奖励塑造的稳健代码强化学习
- 你的AI Agent能更省钱吗?探究任务规范对智能体编码任务中Token消耗的影响
- 反例作为智能体自我修正的反馈
- 语法对齐解码:保证结构化生成的正确性与概率保真度
- MaxKernel:面向 TPU 的智能体内核生成
- 具备底层感知能力的AI智能体:将执行上下文作为一等输入
- 差异补丁 vs. 整体文件:Flutter/Dart 代码模型迭代编辑式与直接生成式的实证比较
- PETSc 中 AI 生成科学计算代码的智能体评估框架
代码统计
代码综合
代码翻译
代码表示学习
代码质量
代码迁移
代码重构
令牌效率
以太坊
价值对齐
价值网络
价值网络初始化
价格冲击
任务一致性
任务卸载
任务完成度
任务拆解
任务覆盖率
任务规划
任务调度
任务难度
任务驱动
仿真优化
仿真到真实
仿真到真实(Sim-to-Real)
仿真器
仿真基底推理
仿真框架
仿真测试
仿真评测
仿真预训练
企业AI
企业分析
企业数据检索
企业文档检索
企业架构
企业级AI
企业级数据库
企业级系统
企业级部署
企业资源规划
伊斯兰AI
众包标注
优势估计器
优势塑造
优化动力学
优化压力
优化器
优化技术
优化框架
优化流程
优化理论
优化算法
- 二阶 Muon 优化算法的正确实现:谱几何与曲率的原则性结合
- MOON:多任务学习的多目标正交归一化更新
- LP-NAS:基于线性规划的神经架构搜索
- 一维二次曲面上 Adam 优化器稳定性边缘(Edge-of-Stability)的可证明性
- 锚定正则化直接最小二乘法(ARDLS):整合既有优先级算子以实现层次分析法中的权重提取
- 牛顿法的原始加速
- 冠状病毒优化算法 (COA)
- OR-Agent:连接演化搜索与结构化研究,实现自动化启发式设计
会议代理
传感器数据
传感器诊断
传感器选择
伦理判断
伦理治理
伪标签
伯恩斯坦-瓦齐拉尼网络
伽马函数
位置偏差
位置编码
低地球轨道
低延迟
低比特量化
低秩优化
低秩分解
低秩动力学
低秩投影
低秩矩阵
低秩自适应
低秩近似
低秩适配
低资源环境
低资源语言
- MameLoshnLM:意第绪语语言模型与评估基准
- 跨资源区间的依存句法分析:评估高资源与低资源语言上的架构性能
- 基于Whisper的波斯语语音情绪识别中ASR自适应与表征降维研究
- CangjieBench:在低资源通用编程语言上评估大语言模型
- 面向低资源非洲语言的潜空间拒绝锚定:无需重新训练的机械式安全恢复
- 英语-普纳语统计机器翻译系统:实证研究的若干见解
- 超越迁移准确率:面向低资源语言的机制引导受控自适应
低轨星座
住房潜力
体系结构
作用域分类
作者风格迁移
佳能
供应链优化
- RouteCost:一种受生产实践启发的电商预购运费估算多阶段框架
- 智能的影子价格:作为供应链问题的大模型推理质量降级
- 大规模供应链运营中可靠的大模型驱动决策引擎:架构、安全与性能保证
- 大规模供应链运营中可靠的LLM驱动决策引擎:架构、安全性与性能保证
供应链博弈
供应链安全
- 名字也能伤人:定位本地编码大语言模型中因包名幻觉引发的投毒抢注风险
- 相比于谁?大语言模型生成基础设施即代码(IaC)的人类锚定安全基准
- CONTINUITY:面向可组合大模型智能体控制的安全上下文契约
- AI编程助手在安装前会进行安全检查吗?针对研究软件供应链中信任信号的预注册需求侧审计
供应链攻击
供应链管理
依存句法分析
依赖分析
依赖图谱
依赖鸿沟
侧信道攻击
侧扫声呐
保形预测
保真度评估
保角预测
信号噪声比
信号处理
- NASA水手9号探测器是如何进行图像编码的
- 面向大规模与高阶MIMO检测的“学习转换”(Learning-to-Transition)框架
- AudioTQ:一种基于随机哈达玛变换与Lloyd-Max量化的6位CPU音频编解码器
- SignalReasoner:评估3B模型在信号数学推理中的性能上限
- 基于张量分解的导频受限MIMO信道结构化估计
信号时序逻辑
信心校准
信念度
信念校准
信念转移
信息不对称
信息几何
信息安全
- 通过向外部大语言模型隐匿敏感信息实现保护隐私的检索增强生成(RAG)
- 针对大型语言模型的Unicode文本水印方法安全性与可检测性分析
- 同步 Logit 引导:现实世界中的隐写术
- 大语言模型赋能的社交媒体机器人检测系统的攻击与防御
- 超越可复现性:迈向面向安全意识的研究制品评估
信息抽取
信息提取
信息搜寻
信息检索
- 面向搜索智能体的上下文信息策略优化 (CIPO)
- 被遗忘的历史还是经受住时间考验?从信息检索视角看 RAG 的回顾与展望
- 迈向基于查询覆盖率与声明可验证性的查询无关型 RAG 评估
- 基于角色条件设定的大模型信息检索评估评估员敏感性探针
- HAM-RAG:面向结构保真交错生成的层级感知多模态RAG
- SkillSight:校准技能检索中的通用内容偏差
- 解构推荐系统中的内容陈旧度:用于替代与衰减的双滤镜框架
- 意图驱动的动态分块:基于预测信息需求的文档切分方法
- 倒排索引遍历的 \(mathbf{P}\)-完全性:布尔查询 DAG 评估的计算复杂度研究
- rEDMRec:将大语言模型推理蒸馏为可编辑的推荐经验记忆
- RAG 亟需建立索引:为什么写入时编译优于查询时解释
- 通过查询覆盖率与声明可验证性实现与查询无关的 RAG 评估
- 为什么是这个而不是那个?通过挖掘用户画像实现成对反事实解释
- LoRA微调过程中公理化注意力模式带来的相关性涌现
- PARTAB:基于结构化证据和分区感知推理的可扩展表格理解
- RAT:用于RAG评估的统一贝叶斯模型
- 超级智能检索代理:Agentic 检索的下一个前沿
- 训练知识库:面向智能体策展文档库的监督式结构学习
- 选择而非训练:基于大模型选择器的模块化实体消歧的优势
- PRISM:基于大语言模型的智能体检索多跳问答系统
- 面向行业标准电网信息与交换模型问答的种子锚定预算受限图渲染
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- STAIR (结构感知信息检索器):用于文档结构增强的新型数据集与大模型检索器
- Reflect-SQL:基于自我反思的 Text-to-SQL 框架
- 当优化演变为操纵:防御针对生成式搜索的恶意生成引擎优化
- SHELF:用于多任务书目基准测试的合成评估框架
- 继承式智能体记忆预算验证中的计划指针与记录指令形式
- 超越单次扩展:面向多跳检索的对比证据探索
- Matryoshka 哈希表示:面向模型感知的紧凑语义检索
- OpenResearcher:用于长程深度研究智能体轨迹合成的完全开源框架
信息泄露
信息流
信息流控制
信息物理系统
信息瓶颈
信息论
- 提示词的价值:一种大模型相对柯尔莫哥洛夫复杂度的方法
- 半导体工艺动力学的信息论因果建模
- LZ 惩罚:自回归语言模型的一种信息论重复惩罚机制
- 通过组合边界与安全性持久性实现大模型安全性的认证多轮鲁棒性
- RoboShape:面向隐私感知机器人感知的基于信息论的点云表征
- 解释的数学理论:理性熵、谱读出与作为资源的混淆性
- 面向海上监控中异构传感器选择的强化学习
- VAE 与扩散模型的泛化能力:统一的信息论分析框架
信用分配
- AgentOPSD:面向智能体强化学习的递归自蒸馏方法
- Gated-BEPO:面向大语言模型智能体的置信门控贝尔曼信用分配
- 教授幅度而非方向:面向多轮多步LLM智能体的验证器有界信用分配
- 纠正你所看不见的错误:多模态推理机中感知蒸馏的归因问题
- MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映
- 让信用跟随计算:面向大语言模型强化学习的架构感知信用传递
- FARCA:面向具有事实监督的强化学习的事实对齐可靠性感知信用分配
- 无真实标签的信用分配:基于执行重放对大模型智能体步级信用分配进行审计
- VICT:面向长视距大模型智能体强化学习的验证器注入信用追溯
- DRACO:基于动态评分标准的长期智能体训练细粒度信用分配
- 多套具现强化学习学到了什么?编码智能体中的归因与可迁移性
信用分配问题
信道压缩
倒排索引
候选集干扰
假信息传播
假设检验
假设生成
偏好优化
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量化无人机导航潜能
- 强化大语言模型中步骤级推理以实现高效自我纠错
- 基于偏好的自蒸馏:通过奖励正则化超越 KL 匹配
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量级无人机导航潜能
- 陷于故事:多轮大语言模型对话中的叙事捕获现象
- 审计多智能体大模型推理树:性能超越多数投票与LLM作为裁判
- 扩散语言模型中的原位指令遵循
- 超越单一负样本偏好:面向大模型历史实体链接的多负样本 DPO 方法
- 你无法偏好未曾采样的情感:DPO微调大语言模型中的强度不足现象
偏好学习
偏好对齐
偏好蒸馏
偏差检测
偏差缓解
偏微分方程
- 偏微分方程基础模型的无监督自适应
- 两步式 MV-DeepONet:由随机输入场驱动的不确定性传播概率算子学习
- 面向长时序PDE预测的几何感知增量神经算子
- 看见、假设与验证:用于发现控制偏微分方程的多模态智能体框架
- 神经算子的保角不确定性量化保证
偏滤器热通量
偏见检测
偏见消除
傅里叶变换
储备池计算
像素空间建模
儿童教育
儿童语音
元学习
元数据
元数据优化
元数据感知
元数据提取
元认知
元认知引导
元认知敏感性
先进过程控制
先验分布
先验数据拟合网络
先验注入
光变曲线
光子集成电路
光学相干断层扫描
光学窃听
光谱学
光谱解混
光谱预测
克罗内克分解
克罗内克近似
免训练
免训练优化
免训练缓解
入侵检测
入侵检测系统
全双工语音智能体
全局-局部正则化
全局一致性
全局优化
全局工作空间
全局工作空间理论
全景分割
全模态
全能大模型
公交调度
公共卫生
公平性
公平性不变式
公平性评估
公民智能体
共同演化
共形预测
共生AI
共轭梯度优化
关系代数
关系型推理
关系型数据库
关系学习
关系智能
关系线性度
关联记忆
关键基础设施
具身AI
具身智能
- 用一张纸劫持机器人:VLM控制机器人中物理提示词注入的系统性研究
- 流匹配不确定性的几何学:零成本不确定性代理及其在基于流的VLA故障检测中的应用
- PhaseCoder:面向多模态大语言模型的麦克风几何结构无关空间音频理解
- NVIDIA Cosmos-H-Dreams:将实时生成式模拟引入手术机器人
- Grabette:用于录制机器人操作数据的开源系统
- Capek 0.5:面向具身智能的以执行为中心的视觉语言模型
- 基于OpenArm的实验室移动操作之表征交接
- MetaSpace:面向具身智能体空间认知的变形测试框架
- 从恢复到断崖:动作后训练如何削弱视觉语言模型(VLM)的深层深度可解码性
- TMRL:扩散时间步调制预训练助力高效策略微调
- 从世界模型到世界行动模型:机器人学简明教程
- FACT:世界-动作模型的故障感知因果训练
- 通过SLM与边缘计算增强虚拟智能体:思考与记忆过程的探索性评估
- AeroCopilotBench:在交互式虚拟座舱环境中评估大模型智能体作为航空副驾驶的双层基准
- DeepInsight II:从基准测试到机器人的完整追踪
- Chronocooked:强化学习智能体隐式区间计时基准测试
- GaussMemory:面向长序列机器人操作的任务驱动型 3D 高斯场景记忆
- 在仿真中预训练视觉灵巧操作
- WorldLines:长时序具身状态智能体的基准测试与建模
- 言语无害而行动致命:在隐状态风险空间中探究超越文本越狱的物理越狱
- DECOWAM:面向四足移动操作的解耦式全身世界-动作模型
- 运行级数字孪生诊所:实现具身智能基于任务的评估
- Meta-Ctrl:通过解耦语法与语义约束实现有保证的计划生成
- Pointing-VLA:面向视觉-语言-动作操作的类型化空间基础接口
- ExPhy:多物体轨迹预测中显式物理属性学习的基准测试
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量级无人机导航潜能
- 解耦规划与控制:面向可指令智能体的 Instruct-to-Act 系统
- 在仿真中预训练视觉灵巧操作
- SimVerity:模拟智能体成功何时能在物理部署中转化为现实?
- 解耦可指令智能体的规划与控制
- Redwood:由AI在两周内从零设计、验证并部署的前沿AI加速器
- CLAP:跨具身视频世界模型作为零样本物理模拟器
- 在仿真中进行灵巧手操作的预训练
- 基于大语言模型程序合成的组合式机械设计
- 联合嵌入预测世界模型在物理规划中取得成功的关键驱动因素是什么?
- 重新审视面向安全关键具身系统的世界模型
- FLY-EVAL++:面向大语言模型安全约束飞行预测的证据驱动评估协议
- FailBench:视觉语言模型在判断机器人任务成功率方面有多可靠?
- 迈向面向目标条件化机器人规划的物理基础 JEPA 世界模型
- 从语言模型到世界行动系统:智能体AI在数字、社交、虚拟与物理环境中的进展与局限
- 学习用于部分可观测性下具身推理的反事实世界模型
- Ambient @ EgoProactive 2026:基于视觉基础监督的主动式第一视角辅助系统
- 语用信息论的数学理论:统一通信、控制与决策
- NVIDIA 开源 OSMO:一份 YAML 编排物理 AI 训练、仿真与真机测试
具身自适应
兼容性验证
内在奖励
内存优化
- APEX:面向内存高效的边缘端 MoE 推理的自适应专家预取技术
- MemSpec:面向边缘设备推测解码自适应草稿调度的内存感知运行时
- vToken:面向可回收 KV 缓存的Token级虚拟化技术
- 基于自适应注意力匹配的推理过程思维感知 KV 缓存压缩
- 优化器状态究竟该存放在哪里?面向内存高效的混合专家模型训练的分层状态分配
- 通过感知I/O重构实现快速且内存高效的小波卷积
- KV-Rescue:通过逐步交织恢复推理语言模型的KV缓存淘汰损失
- 分数衰减 KV 缓存:面向对话系统推理相关性优化的所有权感知内存管理
- TreeWY:门控DeltaNet混合模型的投机验证
- SAEM:用于思维链推理中内存高效 MoE 推理的阶段感知专家管理
- GAMMA:任意预算下混合精度模型的全局比特分配
- KV缓存淘汰的概率解释
- 基于输出重要性的残差稀疏化:用于压缩专家混合大语言模型
- 面向上下文密集型任务的 KV 缓存卸载技术
- HeadWiseKV:混合长上下文语言模型的按头预算化缓存驻留机制
- HFresh:内存高效的向量搜索引擎
- ECOKV:通过互补多样性度量实现几何感知的 KV 缓存淘汰
内存升级
内存压缩
内存安全
内存巩固
内存带宽
内存模型
内存泄漏
内存管理
- 创建一个技术上敏捷但在原公寓外无效的伪敏捷包装器(第四部分)
- 面向大规模 GPU 推理的 KV Cache 预测性多层内存管理
- pgvector v0.7.0 的新特性解析
- GraniKV:针对具有长共享前缀的多智能体系统的非对称粒度KV缓存分页
- MEMONDEMAND:面向大规模企业数据的内存管理系统
- 考量 system.slice 与内核所需的内存容量
- SuperLocalMemory 4.0:面向AI智能体的受管控内存操作系统
- 我们不再使用 Linux 的严格内存超售模式
- GrowPage:用于高效大模型推理服务的按需 KV 预算管理
内存频率
内容分发网络
内容审核
内容提取
内容生成
内容评分
内容防伪
内容陈旧度
内核优化
内核原理
内省
内省推理
内窥镜息肉
内部世界模型
内部机制
内部表征
内部表示
再生核希尔伯特空间
军事测绘
农业AI
冠状动脉疾病
冯·诺依曼自动机
冲突感知
冲突调解
决策Transformer
决策优化
决策偏见
决策动力学
决策图
决策引擎
决策控制
决策支持
决策支持系统
决策智能
决策树
决策框架
决策模型
决策泄漏
决策聚合
冷链物流
准线性标度
凝聚态物理
几何不变性
几何分析
几何学
几何建模
几何性质
几何感知
几何推理
- 已编码但无法利用:冻结大语言模型中几何约束的“解码-生成-引导”鸿沟审计
- 解题不等于画图:奥数几何图示推理基准
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
几何机器学习
几何深度学习
几何结构
凸优化
凸集图
函数符号基础
函数调用
分位数回归
分区感知推理
分子动力学
分子属性感知
分子科学
分层任务网络规划
分层分类
分层协同
分层推理模型
分层索引
分层结构因果模型
分布偏移
分布式事务
分布式优化
分布式存储
分布式推理
- 抛弃锚点:通过 Pulsar Attention 实现分布式系统的统计上下文摘要
- EasyBalance:分布式 MoE 推理中的跨层负载均衡
- 面向英特尔 AI PC 集群的分布式大模型推理预编译流水线分片技术
- 位置至关重要:带有Token裁剪与重排的ViT分布式推理中的特征反演攻击
分布式算法
分布式系统
- 记忆常新,计划陈旧:分布式大模型智能体记忆的依赖域验证
- FinalityBench:评估智能体在延迟与冲突金融终局性下决策的效果级基准
- Meta 推出 ZGateway:统一 ZippyDB 流量、每秒处理超 10 亿次请求的无状态代理层
分布式计算
- 面向智能科学的层级服务器架构
- LGNNIC:利用智能网卡(SmartNIC)加速大规模图神经网络(GNN)训练
- Ready Cohorts:LLM 智能体控制中的 GPU 机会边界与主机往返优化
- TEMPO:跨内存和计算瓶颈区感知完工时间的专家并行负载均衡
- TEMPO:面向内存与计算受限场景的专家并行负载均衡调度器
- 一种用于大模型教师蒸馏标注的可扩展流水线:工作窃取任务调度与内存感知 GPU 并发
- 异构边缘-云连续统中的自适应人工智能任务划分与安全卸载
- 面向可分叉计算的证据感知 MapReduce
- Atlas:在异构集群上优化复合人工智能工作流的部署
- 并行策略链接实现快速训练收敛
- mKernel:面向多 GPU 与多节点的高性能融合算子库
分布式训练
- AWS 上的基础模型训练与推理构建模块
- 并行与分布式推理语言模型的性能基础
- AsyncFlow:面向高效大模型后训练的异步流式强化学习框架
- 基于 LoRA 与 HF Jobs 的异步 GRPO 训练:对象存储、代理与零 NCCL 实践
分布式验证
分布鲁棒性
分支定界
分析存储
分类推理
分词器
分词算法
列关系发现
列生成
列表式选择
创作者风格
创意工作流
创意配额分配
创造力评估
初始距离
判别器
利益冲突
制品评估
制造工艺规划
前向微调
前沿AI训练
前沿研究
前端开发
前缀不变性
前馈网络
剪枝
剪枝与量化
副语言信息
力学理解
功耗性能分析
功耗控制
加纳水文
加速失效时间模型
动作分块
动作分块Transformer
动作后训练
动作控制
动作描述
动作条件生成
动作生成
动作解码架构
动作评估
动作边界
动作预测
动作验证
动力学分析
动力学行为
动力系统
动态MRI
动态上下文
动态交互
动态图神经网络
动态基准测试
动态多级层次结构
动态控制
动态梯度下降
动态模态分解
动态模拟
动态治理
动态界面
动态系统
动态蒸馏
动态规划
动态评分标准
动态调度
动态路由
动态迭代
动态逻辑
动态采样
动物学习
势论
勒姆尼茨曲线
包管理器
匈牙利算法
化学信息学
化学反应预测
区块链
医学AI
医学VQA
医学图像分割
医学影像
- 使用深度学习图像分割和几何建模从零回波时间 MRI 中自动提取的测量结果与专家手工读数高度一致
- 将CT基础模型蒸馏为可编辑概念瓶颈以预测肺结节恶性肿瘤
- 迈向医学影像无监督域适应的实用算法选择
- 利用图神经网络表征心脏组织特性
- 通过CT阅片过程中的3D注视模式预测放射科医生的专业水平
- 面向条件式CMR合成的生成式基础模型元数据感知适应
医学成像
医学推理
医学自然语言处理
医学问答
医疗AI
- 从连续预测变量到临床阈值:基于指南的分类法在缺血性卒中预后预测中的性能权衡研究
- ECG-LENS:融合导联感知与临床上下文的心电图报告生成与评估
- LSEAD:一种基于大语言模型的隐私保护语音分析框架,用于阿尔茨海默病早期筛查
- MedClaw:面向长程手术视频推理的启发式智能体架构
- ETHOS:面向临床多智能体系统的模块化伦理框架
- TokenSTFormer:用于青少年特发性脊柱侧凸筛查的整体运动分析分词时空注意力模型
- 相同事实,不同更新:推理设置如何塑造大模型在医疗资源分配中的行为
- 心理健康教育人工智能:用于自动化临床督导与风险分流的三流微调大模型框架
- 特定领域大型语言模型在回答精神病学患者咨询中的表现
- 医疗大语言模型因果知识图谱接地框架:心血管领域试点研究
- 正确的诊断,装饰性的推理:医疗思维链的扰动审计
- StrokeGuard:用于院前卒中评估的多智能体引导系统
- ProvenanceGuard:基于模型上下文协议(MCP)的大模型智能体源感知事实核查机制
- NeoRed:面向新生儿呼吸系统疾病诊断的知识-逻辑-对齐多模态大语言模型
医疗VQA
医疗专业化
医疗人工智能
- EliSeg:基于报告定位的异常分割与验证目标构建
- 从手册到维护:微调 MedGemma 以支持低资源环境下的多模态影像系统
- 当置信度失效:大语言模型在不确定性与临床信息缺失情况下的过度自信
- 脓毒症治疗的依从性如何?用于生成临床依从性洞察的专家引导神经符号学流水线
- 从通用走向专业:利用冻结视觉语言模型实现内窥镜息肉报告的上下文融合框架
- 临床长文本推理的抑制性注意力机制:电子健康档案处理中迷失在中间效应的表征与缓解
- 从超声报告提升 O-RADS 风险分层:混合推理与端到端大模型推理策略的比较评估
- ARC-CT:面向3D胸部CT的解剖路径对比视觉语言学习
医疗保健
医疗器械
医疗图像处理
医疗大模型
- 教会智能体AI学习罕见病诊断的专家推理能力
- Foresight-England:新冠疫情期间用于医疗事件预测的国家级电子健康记录生成式AI模型开发
- EviDx:基于脚手架大模型智能体的证据感知主动诊断框架
- MediSkill-Evo:基于过程约束的自进化技术实现有据可查的临床交互
医疗影像
- MRIComp4Flow:用于训练多模态生成模型的 3D 脑部 MRI 压缩
- 使用3D生成式AI从基线MRI合成烟雾病术后乙酰唑胺脑血流图
- 肺癌组织病理学深度学习架构的综合基准测试
- 解剖学先验信息神经网络:在损失函数与网络架构中编码解剖学先验,并结合SE(3)公式建立导丝诱导的腹主动脉髂动脉变形模型
- 微调心电图基础模型以预测冠状动脉CT血管造影结果
- Egosurg:利用环境摄像机进行手术室工作流第一人称回放的任意视角合成
- 跨四个国际胸部X光队列的BiomedCLIP联邦LoRA自适应研究
医疗影像分割
医疗影像分析
医疗影像处理
医疗推理
医疗数据协调
医疗时间序列
医疗机器人
医疗机器学习
医疗知识图谱
医疗诊断
半导体制造
华为昇腾
协作AI
协作学习
协变量漂移
协同工作
协同感知
协同推理
协同编辑
协同进化
协议层设计
协议设计
卒中评估
单次推理
单目深度估计
单细胞生成
单细胞组学
单调性
博弈论
- 资源化权威:部署态AI智能体参与式治理的机制设计模型
- 保留、定制还是退出:LLM推理服务中的默认设计与代币定价
- CoupVisor:基于回合与质疑决策支持的策略优化
- 开放策略独裁者博弈:相互透明环境下的合作
- 结构化但脆弱:论大语言模型在网络安全决策中的局限性
- 3×3 棋盘上的 2048 游戏博弈分析
- 大语言模型中战略选择的内部解剖
- GPU-CFR:通过编译为静态数据流与 CUDA Graph 重放实现 80 倍逆事实遗憾最小化加速
卢卡谢维奇逻辑
卫星视觉
卫星计算
卫星调度
卫星遥感
印度语言
即插即用
卷积神经网络
历史
历史回测
历史实体对齐
历史文本处理
历史溯源
压力测试
压缩理论
原位提示
原型理论
原子间势
去中心化
去中心化信任
去安全化攻击
参与式预算
参数化设计
参数提取
参数搜索
参数模块化
参数高效
参数高效微调
- LoCA:基于局部信用分配与单次校准的大模型前向微调方法
- IFCLoRA:面向参数高效微调的拓扑感知秩分配方法
- 轻量级微调下的路由器敏感性识别混合专家模型中的可剪枝专家
- CLEAR:用于保持模型效用的连续潜在适配器路由大模型安全对齐
- 罗马乌尔都语仇恨言论分类:参数高效微调与提示工程的比较研究
- DiaRelay:利用恒定大小内存进行对话情感识别的对话上下文传递机制
双塔模型
双层优化
双曲几何
双曲空间
双滤镜框架
双角色标识符
双语推理
双重差分法
反事实学习
反事实归因
反事实推演
反事实推理
反事实模拟训练
反事实测试
反事实规划
反事实视频生成
反事实解释
反事实追索
反事实集成解码
反例引导
反向传播
反洗钱
反编译
反词元化
反馈共享
反馈机制
反馈架构
取证分析
受众边界
受监管行业
受限解码
变分优化
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
变分学习
变分推断
变分自编码器
- λSplit:用于荧光显微成像的自监督内容感知光谱解混模型
- 当隐空间遗忘像素:恢复扩散Transformer超分辨率中的保真度
- ELVAE:基于证据学习的变分自编码器用于不确定性感知的生成
- 可缩放矢量图形的潜在空间
- 通过 Transformer 变分自编码器学习稀疏决策树
- VAE 与扩散模型的泛化能力:统一的信息论分析框架
变分量子电路
变压器
变压器架构
变异数分解
变异测试
变形测试
变量重要性
叙事捕获
叙事生成
叠加推理
句子嵌入
句法分析
召回率
可信度
可信溯源
可复现性
- 所有大语言模型都能感知自身是否在输出有害内容吗?针对模型家族潜在空间安全探测器的可复现性研究
- 迈向预测性流程挖掘的可复现性:SPICE —— 一个深度学习库
- trajectory-judge:仅看结果的 LLM 评判器在评估智能体轨迹时遗漏了什么
可复现性审计
可审计AI
可审计性
可微代理模型
可微分仿真
可微分编程
可微计算
可执行图
可扩展性
可持续性
可持续计算
可移植性
可穿戴医疗
可穿戴计算
可观测性
- TelemetrySuffBench:智能体遥测数据是否足以进行故障根源诊断?
- OpenTelemetry 进展受阻:一场关于稳定性、规模与维护者的危机
- 保真度远远不够:面向智能体数据表提取的调度级插桩技术
可视化分析
可视化编程
可解释AI
- 结构动力学图世界模型:统一建模、约束展开与可解释校准
- 虚拟细胞的人机协同因果知识注入
- MusicLayout:用于可控文本生成音乐的显式结构规划
- 忠实、充分且可解释:通过离散扩散反演重新审视图反事实解释
- 面向无人机入侵检测的对话式与仪表盘式可解释AI:操作员信任与依赖性的实证研究
- 可解释架构的图形化设计
- GRALIS:融合联盟与梯度归因,具备闭式守恒误差与有限样本保证
- 时间序列分类中可解释人工智能的软件框架:系统性综述
- 漂移自适应的ICU干预预测:冻结生理特征编码器以实现可审计的模型更新
- 可操作的CBFI:将结构分解与因果反事实追索集成用于表格机器学习
- 价格与交易动态的可解释深度学习:从黑箱预测到高效参数化模型
可解释人工智能
- HyperANFIS:通过双曲几何增强自适应神经模糊系统中的规则表示与可解释性
- 面向多分类皮肤病变分类的不确定性感知的可解释集成深度学习框架
- 可解释计算机视觉中的类激活映射:CNN、Transformer与基础模型时代视觉解释的方法论中心综述
- 解决可解释人工智能中的选择问题
可解释性
- 基于决策树剪枝的可解释强化学习
- 权重空间消融下的跨层交互:闭式注意力雅可比边界与真实预训练模型测试
- 上游决策,滞后写入:定位与评估多语言 MoE 的跨语言拒绝电路
- 从恢复到断崖:动作后训练如何削弱视觉语言模型(VLM)的深层深度可解码性
- Mechanist:将人工智能作为探索智能机制的科学仪器
- 通过非局域性测量 SAE 特征的语义抽象度
- DMDIntel:通过动态模态分解解释大语言模型
- 预测性记忆定位:从内部信号预测选择性干预路径
- 已编码但无法利用:冻结大语言模型中几何约束的“解码-生成-引导”鸿沟审计
- LEDGER:用于审计 LLM Agent 的声明-证据追踪图
- CulTrace:追踪大语言模型内部的文化推理过程
- 用于视觉表征学习的双曲层次聚类
- 大语言模型还能解释自己吗?量化对自解释影响的研究
- Diff Mining:通过Logit差异揭示微调目标
- 激活引导的信号来源:激活引导中的激活源选择
- 滞后耦合:内部表示在具备因果效力之前就已经可读
- DNative-Twin:用于可重建智能体决策的决策图与数字孪生
- 一种计算上可行的因果概率解释框架
- 数值数据可解释异常检测的可微区间瓶颈
- 当金融微调失效:领域适应大模型中数字幻觉的三级可检测性分析
- 大语言模型中的证据整合机制
- 从语言模型嵌入中恢复时间与地理信号
可解释性AI
- Transformer 难以利用其涌现的世界模型:重探河内塔与思考的错觉
- 将CT基础模型蒸馏为可编辑概念瓶颈以预测肺结节恶性肿瘤
- 扰动响应中证据、矛盾与脆弱性的分解
- 你的注意力指标究竟在回答哪个问题?作为成分数据的注意力行
- 大语言模型能解释飞行安全事件吗?一种先验引导的语义大模型方法
- TSQueryBench:用于时间序列解释的大模型裁判评测基准
- LoRA微调过程中公理化注意力模式带来的相关性涌现
- 从信息流视角看可解释性需求:规范与验证
- 多语言仇恨言论检测的训练期可解释性:将模型推理与人类理由对齐
- ExecRubrics:用于可验证且高效长文本评估的可执行工具增强评分准则
- 生物学中AI模型的高效自动可解释性
可解释性人工智能
可解释性推荐
可解释性机器学习
可解释机器学习
可计算科学
可识别性
可迁移性
可靠性
- 衡量语言模型智能体中的跨任务行为一致性
- 绝不返回具体数值:面向以事实形式消费答案的 AI 系统的结构性弃权
- 自信且错,悄无声息:端侧部署语言模型未遂故障审计
- SuperLocalMemory 4.0:面向AI智能体的受管控内存操作系统
- 廉价验证器与巨大的盲区:衡量降本级联的可靠性代价
- 清洁工程,不稳定测量:黑盒大语言模型观察者在共享端点上预注册的可靠性失效
可靠性评估
可靠性验证
可验证奖励
合作博弈
合作博弈论
合成数据
- 随机鹦鹉还是和谐共鸣?测试五大主流大模型利用合成数据复刻人类调查的能力
- 在安全调查中使用和评估大语言模型作为替代专家的框架:可靠性、偏见与影响
- 使用合成数据训练热红外图像中的无人机检测
- 模型坍塌与应对策略综述
- 从文档到推理:面向金融数值推理的验证型合成数据流水线与语义感知微调
- Xiaomi-TabLDM:表格基础模型技术报告
- 合成数据能将泰语 OCR 推向多远?
- ScoreMix:利用扩散模型中的分数组合生成合成数据以提升识别性能
- 当合成数据带来负面效应:大模型智能体技能检索中的灾难性遗忘研究
合成生物学
合成表格数据
合成角色预训练
合规性
合规检测
同态加密
同行评审
名字图谱
后期交互
后端开发
后端架构
后训练
- FlavourBench:用于大语言模型评估与后训练的可执行烹饪奖励地图
- 上下文对齐增益由预存在机制介导:GRPO、SFT与DPO的审计分析
- 后训练语言模型在编程竞赛中实现金牌表现
- 顺序优于联合:探索策略内蒸馏与RLVR之间的相互作用
- 极度稀疏的监督信号即可激发大模型的推理能力
- AsyncFlow:面向高效大模型后训练的异步流式强化学习框架
后训练量化
后门攻击
- 绕过 Krum:联邦学习中的感知选择性后门攻击
- 大语言模型智能体中的后门净化动态学
- 锚定偏差:面向持续学习的多模态大语言模型持久性公平后门攻击
- 大语言模型中的量化触发式后门:跨量化器可迁移性与验证-部署鸿沟
后门检测
向量图形
向量嵌入
向量搜索
- 使用 PGlite 和 Transformers.js 在浏览器中实现语义 AI 搜索
- Hugging Face Inference Endpoints、Jobs 和 Buckets 如何驱动 Papers with Code 的搜索功能
向量数据库
- AkasicDB:基于统一向量-图-关系型 DBMS 演示全能检索增强生成(Omni RAG)
- pgvector v0.7.0 的新特性解析
- 停止全精度索引:重新审视向量嵌入的聚类方法
- 伪装成对数的幂律:探究基于图的向量搜索的可扩展性
- 构建 Foundry (第三部分):从创意归档到智能检索
- HFresh:内存高效的向量搜索引擎
向量检索
- 超越 Top-K:用可解释的智能体操作替代黑盒检索
- 使用双角色标识符的生成式通用多模态检索
- 停止全精度索引:重新审视向量嵌入的聚类方法
- 基于目标侧阅读器适配的跨模型记忆迁移
- 语义压缩树:通过分层语义残差实现多分辨率知识检索
- 长运行 AI 智能体内存中的“压缩悬崖”现象
- 超级智能检索代理:Agentic 检索的下一个前沿
- Linkup 发布 SPARSEUP:仅 149M 参数的开源最强稀疏嵌入模型
向量索引
向量表征
向量量化
否定性结果
含能材料
启发式搜索
启发式算法
启发式规则
启发式设计
命令行
命令行工具
命令行执行
命令行接口
命名实体识别
品牌识别
哈达玛变换
响应评分
响应面方法
商业决策
商业分析
商业应用
商业构思
商业模拟
噪声隔离
四足导航
四足机器人
回音室效应
因子挖掘
因果关系审计
因果分析
因果发现
因果定位
因果审计
因果干预
因果性
因果抽象
因果探测
因果推断
- 观测数据因果推断的最优传输理论入门
- 模型发现智能体:利用大模型辅助的贝叶斯实验设计实现数据高效的机理世界模型发现
- 针对组污染结构化结果的因果推断:可观测商、无损约简与精确随机化推断
- 将相对因果知识付诸实践:基于共享结果私有报告的主干可识别性
- 从预测到增量:大规模目标定位与推荐的因果优化
- 气象驱动的垃圾填埋场无组织排放因果临近预报:助力主动公共卫生响应
- 图手术与 do-算子:无环结构因果模型的精确对应关系
- 当故障发生扩散:智能体检索增强生成中的因果故障归因
- 分层结构因果模型的的可扩展与通用识别:重新审视 STAR 项目
- 潜在通信何时真正发挥作用?多智能体大模型中中继KV缓存的因果审计
- CauseCollab:用于异构协同感知的因果统一与模态无关网络
- LLM因果先验何时以及为何有效:面向摊销因果推断的闭环先验选择
- CausalVerify:面向大模型因果推断工作流的执行接地基准测试
因果推理
- 抽象事件因果规则:归纳与应用
- 迈向用于决策与智能体 AI 的因果数据管理生态系统
- 反事实沙apley信用分配
- 虚拟细胞的人机协同因果知识注入
- 半导体工艺动力学的信息论因果建模
- 基于物理基础的端到端驾驶规划器因果审计
- 关系型结构因果模型
- 可操作的CBFI:将结构分解与因果反事实追索集成用于表格机器学习
- 一种计算上可行的因果概率解释框架
- 大语言模型是否在“自食其言”:多轮交互中的因果历史效应
因果框架
因果状态
因果知识图谱
因果训练
固件逆向
固定点强迫
国产芯片
国际信息学奥林匹克竞赛
国际数学奥林匹克
国际象棋
图世界模型
图优化
图像分析
图像分类
图像压缩
图像去云
图像检索
图像溯源
图像生成
- 当隐空间遗忘像素:恢复扩散Transformer超分辨率中的保真度
- RL原生蒸馏:利用评分轨迹实现少步图像生成
- 从语料库到协同进化能力:面向通用图像生成的以能力为中心的数据设计
- 使用 TRL 与 OpenEnv 训练会用代码画水彩画的代码模型
图像美学评分
图像表示
图像质量评估
图像重建
图变换
图大模型
图学习
图对齐
图引导推理
图形用户界面
图数据库
- AkasicDB:基于统一向量-图-关系型 DBMS 演示全能检索增强生成(Omni RAG)
- 将 Postgres 用作图数据库:巧妙(或超常)运用 pgRouting
- 关系核心图分析:以SQL规模查询图数据,以及为什么节点/边模型是性能税而非连接数据的真实写照
图机器学习
图渲染
图演化算法
图生成
图示推理
图神经网络
- Fluid-DiT:用于流体流动模拟学习的无图扩散Transformer
- 忠实、充分且可解释:通过离散扩散反演重新审视图反事实解释
- sLTN:结构化逻辑张量网络
- 基于图结构的强化学习框架:用于自主LLM智能体的结构化漂移诊断与恢复
- 利用图神经网络表征心脏组织特性
- OceanLight:基于几何自适应非结构网格表示的高效全球海洋预报
- GenEx:通过密码子共现网络进行SARS-CoV-2变异株检测的基于图的表征范式
- 读、写与松弛:为什么神经偏微分方程代理模型需要同时具备全局与局部处理能力
- GraphVid:交互式图可控视频生成
- C-Unseen:利用大模型推理检测动态时序知识图谱中的弱信号
- 基于图结构电子占据离散流匹配的机理反应预测
- 将文本属性图学习中的消息传递重新构想为检索
- 超越扁平网表:用于时序电路可扩展分析的分层图表示学习
- 基于图结构电子占据离散流匹配的机理反应预测
- PPO-STGNN:结合时空图神经网络与近端策略优化的云边端计算DAG任务调度方法
- DNative-Twin:用于可重建智能体决策的决策图与数字孪生
- 基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全性
- LevelSyn:基于层异步图神经网络的物理感知逻辑综合
- SENTINEL-RL:将拓扑推理从安全运营中心(SOC)的LLM智能体中剥离
- LEED:用于GNN过平滑估计与虚拟节点选择的局部嵌入演化距离
- 以具现化作为可迁移词表:使用原生图神经网络实现零样本链接预测
图约束
图结构
图记忆网络
图论
- 零知识证明浅析
- 两个有限前沿切片上的扎兰基维奇精确值
- Conway 99-图问题的强制结构归约与可验证界限
- 图手术与 do-算子:无环结构因果模型的精确对应关系
- AutoGraphForge:迈向图论的自动化发现
圆堆积
土耳其语
土耳其语自然语言处理
在线分配
在线学习
在线广告
在线教育
在线监控
在线蒸馏
在线规划
在线评估
地下水监测
地球物理学
地球系统
地球观测
地理信息
地理信息系统
地理偏见
地理域偏移
地理空间
地理空间基础模型
地理空间编码
场景几何不变性
场景生成
块级并行
垂直划分
城市数字孪生
城市模拟
城市规划
域自适应
域适应
基于能量的模型
基准数据集
基准测评
基准测试
- 具备自主决策能力的自动显微镜基准测试:支持系统资质认证,但未必能泛化至未见任务
- 低频陷阱:视频语言模型在简单事件记账上的失败
- 评估大语言模型中的投资逻辑:迈向个性化金融智能体的真实世界基准
- 基准测试的基准:评估对话智能体评测集
- AI玩商业游戏:在动态模拟中对大语言模型管理决策能力的基准测试
- InferQ:面向量子电路模拟的数据库基准测试
- RepoProbe:使用检查表评估架构感知的代码库理解能力
- Ask-E:用于校准问题生成的环境
- 追求 SOTA:时间序列预测必须采用分类特定的评估方法以消除虚假增益
- 谁来验证基准测试?去中心化大语言模型评估中的信任重构
- TelemetrySuffBench:智能体遥测数据是否足以进行故障根源诊断?
- 表面公平?大语言模型推荐系统中隐藏输出公平性差距的基准测试
- 商业真相而非 SQL 准确性:基于规则门控的 7B 分析智能体表现优于直接提示的 32B 基线模型
- KVDiagnosis:长文本大语言模型中 KV-Cache 压缩的诊断基准
- DSLE:黑暗之魂首领战学习环境
- 无攻击者的游戏:选择压力下大模型驱动搜索中的基准测试指纹识别
- InfraBench:跨层级、全生命周期与风险评估的基础设施智能体基准测试
- EnterpriseRAG:基准测试大模型在非理想企业检索条件下的指令遵循与鲁棒性
- 移动智能体评估中大模型裁判的基准测试
- 智能体网络安全的下一个挑战:一个现实且无污染的逆向工程基准
- 措辞效应:量化大语言模型基准测试中的双向漂移
- LakeQuest:跨数据湖基础问答的三域基准测试
- 这是你的最终答案吗?跨语境一致性作为大语言模型可信度的度量标准
- ARAC:端到端科研中自动化研究对齐与完整性的基准测试
- QuoteBench:匹配分数如何掩盖命令路径失效
- LigBench:面向基于大语言模型的科研构思生成的统一且人类对齐的基准
- EgoMonth:用于长期时空记忆的月度级第一人称视频基准
- NARU:面向日本极长视频的叙事演进与文化细微差别理解基准
- CangjieBench:在低资源通用编程语言上评估大语言模型
- AeroCopilotBench:在交互式虚拟座舱环境中评估大模型智能体作为航空副驾驶的双层基准
- DeepInsight II:从基准测试到机器人的完整追踪
- Chronocooked:强化学习智能体隐式区间计时基准测试
- HarmProfile:刻画前沿大语言模型中的有害分布
- PolyComp:用于评估多模态模型组合式 3D 空间推理能力的基于多方块立方(Polycube)的基准测试
- 针对一个模型封闭,对另一个模型开放:法律多项选择基准测试中的“纯选项可解性”
- 当故事演进时:开放式世界模拟中大语言模型叙事能力的基准测试
- 聚合评分的盲区:衡量商业大模型API迁移中的项目级性能退化
- BEAR-Bench:面向多模态模型的双语企业与学术推理基准
- 评分需要的是评分标准,而非大模型的智能
- 衡量部分得分差距:越南2025年凸性评分方案的严格基准测试
- ComponentBench:诊断电脑操作智能体的组件级故障
- 是什么让软件问题解决任务对智能体来说如此困难?
- OmniHandwritingOCR:用于评估多模态大语言模型手写OCR场景的诊断性基准
- MedStruct-S:面向OCR临床报告的键发现、键条件问答与半结构化提取基准
- 衡量语音识别中的基准过拟合现象
- StateSight:基准测试视觉语言模型中的潜在空间状态重建
- BC-Bench:评估面向 ERP 领域特定语言的智能体工程能力
- WorldLines:长时序具身状态智能体的基准测试与建模
- 看起来对,运行也对:多屏幕移动应用生成的项目级基准测试
- 没有中立的评测框架:现代大模型排行榜是由配置脆弱项构建的
- 超越视觉所见:揭示多模态大语言模型的情境错觉
- ClawProBench:AI 代理的轨迹感知评估
- EarthVerse:跨动态地球系统与自然灾害的科学智能体基准测试
- NL2SHACL-Bench:自然语言转SHACL翻译的基准测试套件
- InfraBench:跨层级、全生命周期与风险维度的基础设施智能体评估基准
- SA-Bench:评估基于大语言模型的论文复现中的语义对齐
- 超越可执行模型:用于物理系统建模的 Pufibara 智能体框架与 Modelica 智能体工作流基准
- ExPhy:多物体轨迹预测中显式物理属性学习的基准测试
- 眼见为实还是先入为主:评估开源多模态大语言模型在反直觉场景中的语言偏见
- FuzzingBrain-Bench V1:评估大语言模型的开放式漏洞发现能力
- DEEPCHART:大语言模型距离实现忠实的数据科学图表生成还有多远?
- 大语言模型长文本生成中大纲阶段的多框架对比研究
- FlavourBench:用于大语言模型评估与后训练的可执行烹饪奖励地图
- PhysElite:大模型距离解决奥赛级物理题还有多远?
- RealSWE:真实用户请求下编码智能体的组合式评估
- LongDS-Bench:长周期智能体数据分析失败机制研究
- CordisBench:语言模型能否在动态智能体运行框架中进行组件生命周期推理?
- 语言模型智能体能成为机械可解释性中得力的电路解释器吗?
- Agent Tools Orchestration 泄露更多:数据集、基准测试与缓解策略
- DuplexSpeechBench-IFEval:评估全双工语音智能体中的隐式指令遵循能力
- HalluPeer:用于检测科学同行评审中幻觉的分类法驱动基准
- KC-Bench:用于评估大模型智能体中知识冲突的动态交互式基准
- InSituMeasure:利用多模态大模型探究工业场景中的情境化测量基础
- ExecRetrieval:衡量代码嵌入检索中的功能正确性差距
- ObserverBench:测试用于干预和控制的机械解释估计器
- 当用户不再主动提问:对话式智能体中上下文驱动记忆检索的基准评测
- FailBench:视觉语言模型在判断机器人任务成功率方面有多可靠?
- SWE-Gate:通过功能测试对软件工程智能体而言远远不够
- K-Bench:衡量模型在真实科学智能体请求上的性能
- PerfReasoning:大语言模型在硬件性能推理上的表现究竟如何?
- 面向嵌套企业级架构的成本感知自然语言转SQL智能体架构与全新基准测试
- 韩国开源公共API的多步工具调用:基准测试与数据合成配方
- GPTNT:基于《保持通话和炸弹不炸》的多模态智能体实时协作基准
- FVSpec:将现实世界基于属性的测试转化为 Lean 挑战
- 记忆究竟何时有用?工具调用大语言模型智能体中长期记忆的成本感知评估
- CausalVerify:面向大模型因果推断工作流的执行接地基准测试
- Harbor Adapters与Harbor-Index:大规模智能体评估的基础设施与精选元数据集
- PETSc 中 AI 生成科学计算代码的智能体评估框架
- 从 MCP 注册表中随机抽取究竟能抽到什么?工具调用基准测试真相剖析
- VQ-bench:可组合式矢量量化框架与评测基准
基准测试合成
基准测试污染
基准评测
基函数
基因组学
- bioMoR:用于高效基因组学习的生物学引导递归混合模型
- GenEx:通过密码子共现网络进行SARS-CoV-2变异株检测的基于图的表征范式
- AI新方法揭示基因组模型从DNA中学习的内容并暴露出隐藏的实验偏差
- 锁定的评估表面:CRISPRi 扰动效应预测中的迁移失败与采样深度纠缠
基因表达
基础大模型
基础模型
- OlmoEarth v1.1:一个更高效的地球观测模型家族
- AWS 上的基础模型训练与推理构建模块
- 偏微分方程基础模型的无监督自适应
- 将CT基础模型蒸馏为可编辑概念瓶颈以预测肺结节恶性肿瘤
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- EEG-PRIME:基于多级条件机制和原型对齐表示学习的脑电图解码模型
- DomusFM:用于智能家居基于事件行为监测的基础模型
- DeepInsight II:从基准测试到机器人的完整追踪
- Foresight-England:新冠疫情期间用于医疗事件预测的国家级电子健康记录生成式AI模型开发
- 归因光谱基础模型中的预处理不变性
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- EEG基础模型的测试时适应:现实世界分布偏移下的系统性研究
- 扩展用于单细胞生成的自回归Transformer模型
- 语义贝叶斯世界模型
- Xiaomi-TabLDM:表格基础模型技术报告
基础设施
基础设施即代码
基础设施管理
增值税判定
增强现实
增量优化
增量学习
增长黑客
声呐成像
声学传感器
声学信息
声学分诊
声学描述符
声学监测
声明级验证
声音质量
复古电子
复古计算
复杂度感知
复杂推理
复杂系统
复购预测
多GPU协同
多专家模型
多专家蒸馏
多人竞技游戏
多任务学习
- 基于多任务一致性的对抗攻击检测
- 通过大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法
- MOON:多任务学习的多目标正交归一化更新
- 利用大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法
- ACQ:大规模在线广告中自动化创意配额分配的落地两阶段框架
多向量模型
多媒体
多字节预测
多数表决
多文档摘要
多智能体
- 面向聚合物自动化粗粒化分子动力学的多智能体框架
- 幻觉雪球效应:将多智能体大模型流水线中的错误传播建模为状态转移
- 多智能体AI工作流中的Token优化与上下文窗口管理
- AgRefactor:用于高层次综合(HLS)兼容性与性能的自进化智能体工作流
- KernelArc:面向GPU内核优化的多智能体框架
- 解决可解释人工智能中的选择问题
- MACD:面向大语言模型的自学习知识多智能体临床诊断框架
- 多智能体金融顾问中的检索增强生成与确定性税务计算:一项 2x2 析因实验
- 强化学习增强的大语言模型智能体求解复杂车辆路径问题
- GoAnt:基于质量-多样性多智能体搜索的市场微观结构数据Alpha因子挖掘
- SRPO:多智能体大语言模型的集合相对策略优化
- Stellar Colosseum:面向数学与理论计算机科学长程研究的多智能体竞技框架
多智能体协作
多智能体协同
多智能体大模型
多智能体强化学习
- 何时通信:多智能体强化学习中有原则的门控机制的信念分布与KL散度
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- 巩固世界的边缘:多智能体世界边界中的持续学习问题
多智能体框架
多智能体系统
- OrchestraBench:评估多智能体编排的失效模式、恢复能力与任务拆解质量
- 抽象事件因果规则:归纳与应用
- 资源化权威:部署态AI智能体参与式治理的机制设计模型
- 深入剖析 EvoMap:自进化智能体间协作网络的特性研究
- 将分诊决策拆分给多个智能体:是隐藏了偏见还是有助于发现偏见?基于LLM资源分配在审计容量限制下的多智能体模拟研究
- 交互催生独立状态下所不具备的动态AI行为
- 基于多智能体取证推理的通用深度伪造视频检测
- 复杂天然产物的策略优先合成规划
- AutoMOOSE:用于自主相场模拟的智能体AI
- 基于技能的智能体AI系统中的动态联盟形成与通信定价
- 大语言模型在工艺流程图工程中的应用:从最优PFD到验证级P&ID
- 多LLM智能体系统的动态治理与协作对话成果
- GUIDE:企业级文档到工件生成的受控统一智能框架
- DREAMS:基于密度泛函理论的智能材料仿真研究引擎
- StateBridge:大模型多智能体系统中无需训练的隐状态对齐潜在通信方法
- MARC v1:用于临床 AI 推理与协作的开源多智能体框架
- AQuA:递归自我提升的量化交易研究智能体
- AaLLM:使用大语言模型实现从拓扑生成到尺寸优化的端到端模拟电路设计框架
- 揭露人工智能多智能体系统中的对话偏见
- 学习型多智能体系统的延迟感知编排
- 多智能体语言模型中的道德风险
- 自主芯片设计中的智能体编排
- MACS:用于可靠对话式电商推荐的混合多智能体框架
- LLM智能体能进行理性谈判吗?基于A2A/MCP协议的可验证多智能体交互机制设计框架
- 有界智能体:多智能体AI系统的委派安全性
- 智能体物理学:统计力学预测人工智能群体的集体行为
- 开放策略独裁者博弈:相互透明环境下的合作
- 长周期多智能体大模型商业环境中的涌现性错位通信
- ETHOS:面向临床多智能体系统的模块化伦理框架
- MistyPilot:通过多智能体大模型技能编排实现社交机器人控制
- GraniKV:针对具有长共享前缀的多智能体系统的非对称粒度KV缓存分页
- GxP-Agent:用于基于大语言模型智能体实现可靠临床试验编程的进程有向无环图拓扑
- DecPOMDPs 爆炸难题的奇案:通过策略计数实现“防火墙”
- 集体反事实规划:表征约束下的协调、同意与验证
- Distribird:基于文献信息的贝叶斯模型校准先验分布设计
- CLAIR-Fin:用于跨模态金融问答的声明级验证与自适应辩论对抗性多智能体框架
- 超越文本记录:检测潜在多智能体通信中的隐蔽协同
- 从多智能体到单智能体:什么时候技能蒸馏才真正有效?
- PrimeAgentOrchestrator:面向个人 AI 基础设施的记忆预加载智能体衍生系统
- 基于边缘计算的代理式检索增强生成技术:用于联邦公路管理局(FHWA)桥梁检测合规性
- 同行投票LLM智能体压力测试:发现信息流诱导的词汇趋同,但分布式来源并未带来可靠的匹配曝光优势
- HANSARD:面向自主多智能体AI系统的取证就绪、运行时见证与分级归因参考架构
- Clinical Graph-JEPA:用于认知决策支持的预测性患者状态知识图谱
- 增值税判定中的大模型智能体任务拆解规模优化:一项试点对照实验
- 开放世界多智能体环境中的自主数学发现
- MARS:面向竞技编程的多专家大模型接力系统
- StrokeGuard:用于院前卒中评估的多智能体引导系统
- Eluna:用于自动化仓库运营的推理与任务执行智能体系统
- 解耦规划与控制:面向可指令智能体的 Instruct-to-Act 系统
- 潜在通信何时真正发挥作用?多智能体大模型中中继KV缓存的因果审计
- 联邦化几乎免费,推理则不然:蛋白质表征工作流中 AI 联合科学家的权衡
- AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索
- 解耦可指令智能体的规划与控制
- DSA:面向多市场股票研究的证据感知大模型智能体编排框架
- 大模型驱动的群集智能:新前沿还是概念延伸?
- 联邦几乎零成本,推理则不然:蛋白质表征工作流中AI联合科学家的权衡
- GOD:治理、观察与指挥 —— 智能体社会的实时控制室
- EULER:利用经证据校验的回传机制探索多智能体数学发现中的未充分利用链接
- Dude:用于论文与代码差异检测的双重检测多智能体系统
- 智能体AI系统的价值保留架构
- 自主研究智能体群体中涌现作弊与吹哨行为的案例研究
- 基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全性
- 文明框架:个人多智能体系统间基于主权锚定的通信
- 审计多智能体大模型推理树:性能超越多数投票与LLM作为裁判
- OR-Agent:连接演化搜索与结构化研究,实现自动化启发式设计
- CUSP:多智能体多模态推理的可分解集体不确定性
- MOSAIC:用于跨范式智能体混合与人机协作的通用智能体级接口
- 我是如何借助 AI 与 Lean 证明康威50年猜想的:Dan Abramov 的一月通关实录
多智能体谈判
多智能体路径规划
多样性优化
多模态
- 使用 Sentence Transformers 构建多模态嵌入与重排模型
- 使用 Sentence Transformers 训练和微调多模态嵌入与重排模型
- 使用 NVIDIA NeMo Retriever、托管 NIM、LanceDB、重排及基础生成构建多模态 RAG 管道
- 迈向高效的科技情报多模态多语言观点提取:基于 QLoRA 的微调方法
- DF-MoE:基于多模态稀疏混合专家的通用深度伪造检测
- PhysElite:大模型距离解决奥赛级物理题还有多远?
- 大型视觉语言模型中用于缓解幻觉的动态对齐补偿方法
- 大语言模型时代的医学推理:增强技术与应用系统的全面综述
多模态AI
多模态RAG
多模态上下文
多模态交互
多模态仿真
多模态传感
多模态信号
多模态分析
多模态命名实体识别
多模态基准
多模态大模型
- PaDoc:基于版面基础的文档解析并行解码框架
- PhaseCoder:面向多模态大语言模型的麦克风几何结构无关空间音频理解
- 基于多智能体取证推理的通用深度伪造视频检测
- 我在视频中寻找你:面向以人为中心视频推理的身份条件化查询
- CASA:基于安全注意力增强分类的鲁棒多模态对齐
- MetaSpace:面向具身智能体空间认知的变形测试框架
- 提升多模态 RLVR 的泛化鲁棒性
- 听觉、视觉与追踪:全模态语言模型的时空视听声学事件推理
- UniTraffic-Agent:2026年AI城市挑战赛赛道3的统一交通视频推理与双重跨领域评估
- EgoMonth:用于长期时空记忆的月度级第一人称视频基准
- NARU:面向日本极长视频的叙事演进与文化细微差别理解基准
- BUZZY:通过对比打分缓解多模态多项选择问答中的文本诱导偏差
- 提升多模态 RLVR 的泛化鲁棒性
- VTInstructor:用于连续环境中导航指令生成的视觉轨迹提示方法
- 深度思考对齐:用于视频推理的轨迹级潜在蒸馏
- 结果一致而视线分歧:具中心凹视觉的多模态大模型如何进行视觉搜索?
- MLLM引导的文本转视频生成语义纠错
- BEAR-Bench:面向多模态模型的双语企业与学术推理基准
- FormalAnalyticGeo:基于神经符号架构的多模态解析几何题目生成框架
- 看起来对,运行也对:多屏幕移动应用生成的项目级基准测试
- SonarLLM:用于水下感知的原生声呐-光学多模态大语言模型
- OmniFusion:基于模块化融合的端到端多语言多模态同步翻译
- InSituMeasure:利用多模态大模型探究工业场景中的情境化测量基础
- StrixAE:面向真实场景复杂失真耦合的音频增强智能体
- 迁移安全意识:多模态大语言模型中的跨模态安全漂移
- 问两次,看两次:提示词回显解决了视觉语言模型中的“问题前置悖论”
多模态大语言模型
- UniVVT:用于高保真视频虚拟试穿的统一端到端框架
- 多模态大语言模型不断演进的安全格局:新兴威胁与防御综述
- MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映
- OmniHandwritingOCR:用于评估多模态大语言模型手写OCR场景的诊断性基准
- 超越视觉所见:揭示多模态大语言模型的情境错觉
- 锚定偏差:面向持续学习的多模态大语言模型持久性公平后门攻击
- 眼见为实还是先入为主:评估开源多模态大语言模型在反直觉场景中的语言偏见
- 位置即全部:基于多模态大语言模型的指代表达式分割免训练Token压缩策略
- 多模态大语言模型内部视觉表征的因果探测
- NeoRed:面向新生儿呼吸系统疾病诊断的知识-逻辑-对齐多模态大语言模型
- GraFT:通过3D场景图实现多模态大语言模型空间推理的免训练框架
- 多模态大语言模型内部视觉表示的因果探测
多模态学习
- GAUGE:面向不完整多模态分类的粒度自适应反事实证据门控
- 基于深度引导的拥挤场景视频目标计数
- SLED:通过知识蒸馏实现可扩展的位置编码
- SignLlama:通过优先处理视觉特征增强无词汇表手语翻译
- 从多模态伪标签中学习:实现鲁棒的开放词汇实例与全景分割
- 视觉语言模型内部伪装视觉上下文的隐藏演化
- MobileMem:基于一年期移动端体验的学习研究
- 多模态生成式模糊系统:模糊推理引导的大模型交互式问答框架
- TRACE:基于多源证据溯源的代理式商品目录增强框架
- 基于查询的长文档多模态信息抽取
- 带着意图行动:为视觉-语言-动作模型蒸馏行为意图
- 关注学生:在线学习中用于自动化参与度预测的行为与上下文线索
- 从语料库到协同进化能力:面向通用图像生成的以能力为中心的数据设计
- DEEPCHART:大语言模型距离实现忠实的数据科学图表生成还有多远?
多模态对齐
多模态序列推荐
多模态情感识别
多模态推理
- 纠正你所看不见的错误:多模态推理机中感知蒸馏的归因问题
- GeoExplain:基于街景视觉信息层级的多模态推理
- CUSP:多智能体多模态推理的可分解集体不确定性
- 利用强化学习激发多模态推理代理的自我验证能力
- Scratchy:基于视觉草稿板的多模态推理在EasyCrypt密码学证明生成中的应用
多模态提取
多模态文档理解
多模态智能体
- 阅读不等于推理:弥合视觉-文本压缩中的智能体策略鸿沟
- REVEAL:用于长视频问答中显式证据充分性验证的评分标准引导智能体
- MBA:面向现实世界商业构思的多模态基准与智能体
- MedClaw:面向长程手术视频推理的启发式智能体架构
- VibeWorlding:多模态智能体能否端到端构建3D开放世界?
- 深陷文本负债:面向MLLM智能体的视觉证据保留上下文剪枝方法
- LUCAID:用于肺癌精准病理学的智能体多模态人工智能
- GraphMemix:面向长期多模态智能体内存的查询感知证据森林
- 看见、假设与验证:用于发现控制偏微分方程的多模态智能体框架
- GPTNT:基于《保持通话和炸弹不炸》的多模态智能体实时协作基准
多模态检索
- 前沿大语言模型能否匹敌原生多模态嵌入?硬负例文本到图像检索的对比研究
- 使用双角色标识符的生成式通用多模态检索
- UMER:通过面向对感知的判别推理统一通用多模态检索的嵌入与排序
- 用于编排异构语音和文本检索器的重排器
- 如何从 PDF 的图表和表格中提取真正的价值
多模态模型
- StepReflect:面向移动端GUI智能体的结构化UI转换反思
- Aero Realtime:实现低延迟流式多模态生成的完全对齐输入输出流
- CADEngBench:看起来像CAD,但它真的能用吗?评估参数化设计、装配推理与物理仿真
- PolyComp:用于评估多模态模型组合式 3D 空间推理能力的基于多方块立方(Polycube)的基准测试
- 轻量级多模态模型能评估大语言模型的推理性能吗?面向计算最优文档推理的研究
- 受限预算的具身感知:四个资源壁垒与31B以下开源模型上访问结构化感知的预注册评估
- 粗粒度索引,细粒度证据:长视频RAG中时间粒度的解耦
- 全能裁判还是全能偏见?通过平衡解耦视角诊断多模态裁判模型
- 音视频模型中的注意力三角形
多模态理解
多模态认知
多模态评估
多模态诊断
多模态预训练
多目标优化
多目标对齐
多租户
多租户安全
多线程
多维评估
多臂强盗算法
多臂老虎机
- 大概率近似正确最大后验推断
- DORA Explorer:在无需训练的情况下提升大语言模型的探索能力
- 生产环境中的多臂老虎机:推理时超参数优化
- 生产环境中的多臂老虎机:推理时的超参数优化
- 面向视觉与语言Transformer的感知损伤多臂老虎机剪枝技术
多表格处理
多视角学习
多视角感知
多语言
- Granite Embedding Multilingual R2:开源 Apache 2.0 多语言嵌入模型,支持 32K 上下文——百兆参数以下最佳检索质量
- 构建低延迟多语言语音智能体:NVIDIA Magpie TTS 带来开源权重与全面部署控制
多语言信息检索
多语言处理
多语言推理
多语言数据集
多语言模型
- 上游决策,滞后写入:定位与评估多语言 MoE 的跨语言拒绝电路
- 上游决策,滞后执行:定位并评估多语言混合专家模型(MoE)的跨语言拒绝回路
- 多语言仇恨言论检测的训练期可解释性:将模型推理与人类理由对齐
多语言泛化
多跳推理
多跳检索
多跳问答
多轮交互
多轮对话
多轮推理
多轮攻击
多轮越狱
多重编码器
多重网格
多项选择问答
大地测量学
大型视频语言模型
大型语言模型
- 针对大型语言模型的Unicode文本水印方法安全性与可检测性分析
- 通过置信度动态实现大型推理模型的提前停止
- 评估工具对人类和大型语言模型(LLM)测量的是同一事物吗?一项潜在结构分析
- 从大型语言模型中直接构建消歧知识库
大型音频语言模型
大推理模型
大模型
- CodeGrep:面向大模型编程智能体的强化学习检索代理
- 面向存算分离 GPU 推理的拓扑感知数据传输技术
- 面向大规模 GPU 推理的 KV Cache 预测性多层内存管理
- REIN:通过反思与弃权对齐弥合推理与可靠性之间的鸿沟
- 移动智能体评估中大模型裁判的基准测试
- 揭秘智能体技能(Agent Skills):它们为何奏效——以及何时会失效
- 幻觉雪球效应:将多智能体大模型流水线中的错误传播建模为状态转移
- 通过数据规模化突破高分辨率天气预报的极限
- 一种用于大模型教师蒸馏标注的可扩展流水线:工作窃取任务调度与内存感知 GPU 并发
- Wuying-Browser-Agent:面向真实世界的长周期基础浏览器智能体
- 面向英特尔 AI PC 集群的分布式大模型推理预编译流水线分片技术
- 没有中立的评测框架:现代大模型排行榜是由配置脆弱项构建的
- 少读多解:面向AI智能体的Token高效稀疏阅读技术
- 从惯性到客观:通过噪声隔离改进深度研究智能体
- 基于布卢姆分类法的超推理模型推理轨迹认知剖析
- 模型发现智能体:大模型辅助的贝叶斯实验设计,实现数据高效的机理性世界模型发现
- 分子大模型智能体:从架构设计到科学自主
- DSA:面向多市场股票研究的证据感知型大模型智能体编排框架
- PhysElite:大语言模型距离解决奥林匹克级物理题还有多远?
- “无瑕”之心铭记什么:知识纠缠如何塑造大模型遗忘后的信息泄露
- 学会记忆:面向长文本推理的记忆智能体端到端训练
- KC-Bench:用于评估大模型智能体中知识冲突的动态交互式基准
- 基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全性
- 极度稀疏的监督信号即可激发大模型的推理能力
- 当大模型反编译工具“编译”更多却“保留”更少
- CausalVerify:面向大模型因果推断工作流的执行接地基准测试
- Ambient @ EgoProactive 2026:基于视觉基础监督的主动式第一视角辅助系统
大模型API迁移
大模型Agent
大模型优化
大模型作为裁判
大模型即裁判
大模型压缩
- 任务特定大语言模型蒸馏的缩放定律
- 压缩三位一体:探索大语言模型压缩的稀疏性、量化与低秩近似
- 基于输出重要性的残差稀疏化:用于压缩专家混合大语言模型
- 4-bit 旋转量化技术深度剖析:消除离群值的极致压缩艺术
大模型可信度
大模型可靠性
大模型后训练
大模型外壳扩放
大模型安全
- 上游决策,滞后写入:定位与评估多语言 MoE 的跨语言拒绝电路
- Tripwire:通过统计认证的安全神经元触发对齐拒绝机制
- 大模型拒绝机制中的对称性破缺:答案释放比恢复拒绝更具局部性
- HarmProfile:刻画前沿大语言模型中的有害分布
- 企业级AI安全指南:面向开发者的NeMo Guardrails实践教程
- 通过组合边界与安全性持久性实现大模型安全性的认证多轮鲁棒性
- 言语无害而行动致命:在隐状态风险空间中探究超越文本越狱的物理越狱
- PsychJail:通过大模型策略的多轮说服探索心理学越狱
- InjecMEM:针对大模型智能体记忆系统的内存注入攻击
- RedEvoAgent:基于经验驱动技能演化的自动化红队测试智能体
- LongGuard:安全护栏长文本失效的机理分析与免训练缓解方案
- REINS:基于稀疏自编码器特征的拒绝增强抑制性调控
- ContextLeak:通过恶意工具窃取大模型智能体上下文
- 分层大模型防御作为集成体系:访问层级、推理成本与防御层之间经测量的失效相关性
- 语义叠加层:超越词元与引导向量的提示词注入防御新范式
- 安全性的不稳定性:随机种子与温度如何暴露出大模型不一致的拒绝行为
- LongGuard:安全护栏长上下文失效的机理分析与免训练缓解策略
- 当安全路由失效:解析良性微调下的对齐脆弱性
- 基于隐式推理的强大且高效的安全护栏
- 续写与拒绝的博弈:大语言模型中续写触发型越狱的机制分析
- 并非所有大语言模型的推理过程都可见于思维链中
- 重形式轻实质:内容不变的外壳如何颠覆大模型安全评判器的裁决
- 引君入瓮与恢复:通过投毒内部拒绝信号防御白盒编辑越狱
- 通过迭代 DPO 从奖励作弊中诱发突发性不对齐
- 反词元化泄漏:从缓存痕迹重建本地大模型输出
- 拒绝的几何学:为什么事后安全机制如此脆弱,而预训练阶段的安全机制能够持久
大模型对齐
大模型幻觉
大模型微调
大模型推理
- 当草稿模型在进化:投机解码与在线学习的完美结合
- 在连续批处理中解锁异步性:将大模型推理速度提升 20% 以上
- LLMVisor:面向多租户大模型推理的实时延迟归因模型
- 复现与压力测试大模型推理可靠性的两种方法:推理期概率聚合与逻辑表征编辑
- 管理KV缓存:防止多租户大模型推理中的定时侧信道泄漏
- MemSpec:面向边缘设备推测解码自适应草稿调度的内存感知运行时
- 双流Transformer:将主预填充路径与额外的解码计算解耦
- TEMPO:跨内存和计算瓶颈区感知完工时间的专家并行负载均衡
- 大模型推理服务的一年:工作负载演进、缓存与负载均衡
- Kalypso:关系型大模型推理服务系统
- TEMPO:面向内存与计算受限场景的专家并行负载均衡调度器
- 思维漏斗:通过早期投票与推演剪枝实现高效的测试时缩放
- 运行时压缩风险定价:压缩服务状态的随时有效准入与服务输出定律
- 超越推理轨迹:将可解释的推理状态读出模块与原生 MoE 路由进行耦合
- 分数衰减 KV 缓存:面向对话系统推理相关性优化的所有权感知内存管理
- 使用 LFM2.5-DSpark 实现高达 3.2 倍的推理加速
- KVBoost:基于偏差引导重计算的块级键值缓存重用技术,助力高效大模型推理
- 智能的影子价格:作为供应链问题的大模型推理质量降级
- 朴素提示词优化:重新审视对复杂提示词搜索的需求
- OpWeave:面向异构大模型推理服务的灵活算子级解耦框架
- Z.ai 详解基于 10 万张国产芯片的 GLM-5.3-Flash 推理系统架构构建
大模型智能体
- 当大模型智能体进行博弈:供应链中的私有信息与动态讨价还价
- RecSys Factory:将大模型智能体自主性限制在工业推荐系统生命周期的决策点上
- 智能体技能也可能带来负面影响:大模型智能体中技能引发故障的实证研究
- 熟能生巧未必安全:自进化大模型智能体中的技能错进化现象
- 可审计智能体:保障大语言模型智能体部署后的责任与透明度
- SkillSight:校准技能检索中的通用内容偏差
- SkillCommit:通过行为验证的范围扩展实现智能体技能演进
- AeroCopilotBench:在交互式虚拟座舱环境中评估大模型智能体作为航空副驾驶的双层基准
- SkillForge:面向特定项目问题解决的自我蒸馏智能体
- 面向工具使用型大模型智能体的完全循环子任务图:长程工作流中的灵活性、成本与瓶颈
- TRACE:面向一致且具备边界意识的大模型智能体的自进化技能库
- 增值税判定中的大模型智能体任务拆解规模优化:一项试点对照实验
- SA-Bench:评估基于大语言模型的论文复现中的语义对齐
- 直接语料库交互中的证据盲区:使用 AtlasNav 进行持久导航
- DSA:面向多市场股票研究的证据感知大模型智能体编排框架
- 超越执行:审计大模型驱动的科学研究中的实验保真度
- VICT:面向长视距大模型智能体强化学习的验证器注入信用追溯
- 跨回合智能体记忆的失效契约
- 自由派生,审慎行动:递归大模型智能体树的渐进风险归属机制
- 生产环境中的多臂老虎机:推理时的超参数优化
- 记忆常新,计划陈旧:分布式大模型智能体记忆的依赖域验证
- CONTINUITY:面向可组合大模型智能体控制的安全上下文契约
- AgentDrift:带有步骤标签的提示词注入劫持大模型智能体轨迹基准
- 当合成数据带来负面效应:大模型智能体技能检索中的灾难性遗忘研究
- Ecdysis:面向大模型智能体运行时脚手架的高效进化训练
大模型服务
大模型机制可解释性
大模型欺骗
大模型漏洞
大模型蒸馏
大模型裁判
大模型训练
大模型评估
- 图结构评分标准:将评分标准编译为用于大模型裁判的类型化评估图
- 知道何时停止:大语言模型评估的贝叶斯最优停止策略
- 针对一个模型封闭,对另一个模型开放:法律多项选择基准测试中的“纯选项可解性”
- ExecRubrics:用于可验证且高效长文本评估的可执行工具增强评分准则
- 评判评判者:将拉施测量理论引入大模型评估
- 评价评估者:将拉斯施测量理论引入大语言模型评估
- K-Bench:衡量模型在真实科学智能体请求上的性能
大模型评判
大模型评测
- StagedWorkspace:面向知识工作智能体的版本化工作空间
- TSQueryBench:用于时间序列解释的大模型裁判评测基准
- 解题不等于画图:奥数几何图示推理基准
- 当名称跨越文字:蒙古世界历史实体对齐的源头依据基准
大模型遗忘
大模型量化
大模型防御
大模型预训练
大模型验证
大纲生成
大规模实验
大视觉语言模型
大语言多模态模型
大语言模型
- 啄木鸟蒸馏:弱模型诊断强模型中的推理缺陷
- 具备自主决策能力的自动显微镜基准测试:支持系统资质认证,但未必能泛化至未见任务
- 衡量与检测有害的AI谄媚行为
- 重精炼胜过重采样:大语言模型推理的测试时自我修正
- 面向工业因果推理的模拟器基座大语言模型:污水处理决策支持中的工具调用、结构化注入与厂间可移植检索
- 大语言模型中思维链推理的平均场动力学
- 观点:是时候优化大语言模型的自洽性了
- 面向模块化大模型安全代理的事后轨迹风险认证
- 评估大语言模型中的投资逻辑:迈向个性化金融智能体的真实世界基准
- 当经验化为指令:自进化智能体技能系统中的轨迹投毒
- ProDVI:用于价值网络初始化的程序化动力学先验
- MACRO:Transformer 层的马尔可夫链路由
- FormBharo:为印度农村地区对话式填表而设计与评估的语音代理
- 面向编码智能体的全局可重用技能学习
- 基准测试的基准:评估对话智能体评测集
- 调用还是不调用:评估与优化大语言模型工具调用的框架
- AI玩商业游戏:在动态模拟中对大语言模型管理决策能力的基准测试
- DASH:用于自动化贝叶斯优化的解耦自适应代理-采集框架
- CUDA-L2:通过强化学习超越 cuBLAS 的矩阵乘法性能
- 短上下文语言建模中的逐层位置偏差
- 基于大语言模型的智能体化软件缺陷修复:综述
- 大语言模型生成式推理中层剪枝的局限性探究
- 全象限有界裁剪 GRPO:消除无界盲区以实现稳定且泛化的训练
- 随机鹦鹉还是和谐共鸣?测试五大主流大模型利用合成数据复刻人类调查的能力
- 在线推理校准:测试时训练赋能可泛化的共形大模型推理
- PICopilot:基于大语言模型的智能体框架,助力光子集成电路脚本化设计
- RepoProbe:使用检查表评估架构感知的代码库理解能力
- 如你所愿:在精准农业中结合大语言模型与形式化验证的任务规划
- A-SR:基于分层协同的自进化智能体大模型符号回归
- Granite 4.1 大语言模型:构建解析
- 让知识蒸馏成本大幅降低以实现规模化运行
- 面向聚合物自动化粗粒化分子动力学的多智能体框架
- 填补鸿沟:用于统一多任务用户意图推理的双知识图谱框架
- 成交还是拒绝:情绪在多智能体谈判中的作用
- 将分诊决策拆分给多个智能体:是隐藏了偏见还是有助于发现偏见?基于LLM资源分配在审计容量限制下的多智能体模拟研究
- 并非所有问题都适合建模为 MILP:一种面向 DSL 的灵活且精确的优化建模框架
- 忽视关键投票:聚合独立性指标未能揭示验证真正起作用的地方
- Transformer 难以利用其涌现的世界模型:重探河内塔与思考的错觉
- 智能体记忆蒸馏:利用分层教师记忆赋能小型大语言模型智能体
- 塑造你的信息流:基于大语言模型的对话式推荐智能体系统
- CoBa:通过计算均衡路由实现高性价比的测试时扩展
- Fisher-R1:训练用于可靠假设检验的大模型智能体
- TEPA:为抗冲突语言智能体撤销陈旧记忆
- 通过对跖分离技术对无偏置 GLU 前馈模块进行密码分析提取
- AI角色会成长吗?重大生活事件后LLM智能体个性演变的分析与基准测试
- NiyamAI:一个基于零知识证明构建、具备密码学可验证护栏的意图绑定型AI智能体
- 通过随机数生成缓解大模型作为裁判时的评分偏差
- 超越“AI语言”:大模型输出具有类个体语言特征(Idiolect)的研究
- 注意力头的自主性:利用冻结的查询-键几何实现免数据的稀疏注意力机制
- 基于智能体混合自顶向下与自底向上方法的知识图谱生成
- PHASE-Tree:长程角色扮演对话中的角色状态演化建模
- 大语言模型的地理空间概念探测:抽象性、组合性与基础性
- 零差距不等同于恢复:基准测试污染的分层逐题概率评估与逐步缓解策略
- LSEAD:一种基于大语言模型的隐私保护语音分析框架,用于阿尔茨海默病早期筛查
- PACE:用于自动化算法设计的原语感知代码演进
- 复杂天然产物的策略优先合成规划
- 反事实模拟训练:提升思维链的忠实度
- INTRYGUE:基于归纳感知的熵门控机制实现可靠的RAG不确定性估计
- Ratchet:LLM裁判需要多高的可靠性才能淘汰一项技能?
- 权重空间消融下的跨层交互:闭式注意力雅可比边界与真实预训练模型测试
- 面向搜索智能体的上下文信息策略优化 (CIPO)
- LoCA:基于局部信用分配与单次校准的大模型前向微调方法
- 抛弃锚点:通过 Pulsar Attention 实现分布式系统的统计上下文摘要
- IFCLoRA:面向参数高效微调的拓扑感知秩分配方法
- 谁来验证基准测试?去中心化大语言模型评估中的信任重构
- 多用户冲突中的权威期望效应
- 用于医疗数据协调的双重混合语义数据湖架构:结合人机协同验证与大模型驱动的元数据标注系统
- 大型语言模型中的量化退化:信号与噪声的视角
- 谁构建了这个模型?通过权重空间的谱指纹追踪大语言模型血缘
- 探索大语言模型在真实海事导航场景中的态势感知与COLREG合规能力
- 你的提示词并非唯一的提示词:大模型对结构化输出模式描述的权重究竟有多高?
- MCP 中的大语言模型至关重要:衡量由大语言模型驱动的低效资源利用
- 是什么阻碍了智能体技能的复用?来自 138K 个 SKILL.md 文件的实证研究
- 表面公平?大语言模型推荐系统中隐藏输出公平性差距的基准测试
- 被遗忘的历史还是经受住时间考验?从信息检索视角看 RAG 的回顾与展望
- MathShikkha:针对孟加拉语数学推理的小型语言模型中“仅答案”与“思维链”监督的对照研究
- FailForge:从持续失败中为代码智能体提炼程序性能力
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- 理解大语言模型免训练低秩压缩中的校准与截断误差传播
- 广度推理而非深度推理:将推理溢价摊销为蒸馏技能
- 开源权重模型在金融文本理解领域能否与闭源模型一较高下?
- 理论指导下的欺骗检测:基于 RAG 的人工智能探索
- 阅读不等于推理:弥合视觉-文本压缩中的智能体策略鸿沟
- 面向主观任务的大语言模型推理:失效模式、缓解方案与动态推理路由
- 不同的反馈,不同的更新:大语言模型基于用户交互的选择性自学习
- 商业真相而非 SQL 准确性:基于规则门控的 7B 分析智能体表现优于直接提示的 32B 基线模型
- 大模型引导的仿真轨迹启发式设计:动态生产与AGV调度案例研究
- P^3:用于验证代码生成的联合程序与证明规划
- 能力不等于倾向:测量公民大模型智能体中抗压协作行为
- 重新思考自进化智能体:我们是否仍然需要既定的优化流程?
- 线性化二维单纯形注意力机制
- 每个模型一个适配器对:语言模型的通用激活接口
- 从单向扫描到边界缝合:交错式跨块后训练量化
- 模型发现智能体:利用大模型辅助的贝叶斯实验设计实现数据高效的机理世界模型发现
- SkillReason:针对隐式用户请求的推理增强型智能体技能检索
- 基于《成人类卡牌游戏》(Cards Against Humanity) 的跨模型幽默偏好建模
- SkillConsist:通过双向图对齐检测智能体技能中的不一致性
- 轻量级微调下的路由器敏感性识别混合专家模型中的可剪枝专家
- 仅凭数值重构元数据:恢复无文档数据仓库中的列语义
- 提示词注入的解构:一种用于结构化分析的组件模型
- 抵御知识投毒与提示词注入的检索增强型入侵检测防御机制
- 大语言模型智能体系统中潜在妥协的组合威胁分析:66号令场景
- PRISM:通过地形诊断进行排列优化的预测性协议
- 所有大语言模型都能感知自身是否在输出有害内容吗?针对模型家族潜在空间安全探测器的可复现性研究
- 推理型大语言模型中的隐藏语言一致性现象
- 缓解英语到罗马尼亚语机器翻译中的性别偏见
- 我们能否优化性能与碳排放的盈亏平衡点?探索更绿色的大语言模型
- 基于RAG的工业现场总线设备自动配置
- 无攻击者的游戏:选择压力下大模型驱动搜索中的基准测试指纹识别
- GALA:微服务根因分析与事件响应的图增强大模型智能体
- 当置信度失效:大语言模型在不确定性与临床信息缺失情况下的过度自信
- SignLlama:通过优先处理视觉特征增强无词汇表手语翻译
- 通过大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法
- 大语言模型在工艺流程图工程中的应用:从最优PFD到验证级P&ID
- 多LLM智能体系统的动态治理与协作对话成果
- 基于逆向心智理论的内容推荐建模:从网页浏览到动态智能界面
- 当自一致性适得其反:多数表决损害小型大语言模型在多数硬科学问题上的表现
- 从数字到判断:面向欧洲上市房地产的专业大语言模型智能体与强化学习
- 前沿大语言模型能否匹敌原生多模态嵌入?硬负例文本到图像检索的对比研究
- 迈向基于查询覆盖率与声明可验证性的查询无关型 RAG 评估
- 定位安全对齐:大语言模型中MLP层与网络中部模块编码拒绝行为
- CLAIM:基于不确定性度量的大语言模型开放域主动澄清框架
- EnterpriseRAG:基准测试大模型在非理想企业检索条件下的指令遵循与鲁棒性
- OEIS Open:语言模型能把多少猜想变成定理?
- 沉睡的智能体:基于要点的上下文压缩丢失了什么及其原因
- 迷失在压缩中:评估上下文压缩下的侧面约束丢失
- 评估网络安全中大语言模型生成的检测规则
- 自进化网络验证器
- 大语言模型智能体中的后门净化动态学
- 影响力策略重要吗?大语言模型代码生成中提示词框架效应的研究
- 强化大语言模型中步骤级推理以实现高效自我纠错
- 智能体网络安全的下一个挑战:一个现实且无污染的逆向工程基准
- GCPO:诊断与约束大模型 Rollout 强化学习中的子空间几何
- 评分标准随机丢弃(Rubric Dropout):缓解以评分标准为奖励的强化学习中奖励攻击的简单方法
- 超越单轮置信度:LLM 智能体的轨迹自适应不确定性量化
- 定位与控制大型语言模型中的隐式个性化
- 语义 Lenia:大语言模型语义空间中稳态孤子的涌现
- 学会说服暴露了大模型轻易放弃正确信念的弱点
- RealisticTritonBench:真实世界 AI 框架中 Triton 内核生成的评测基准
- DREAMS:基于密度泛函理论的智能材料仿真研究引擎
- 作为连续流的工具:演进式智能体推理
- 基于大语言模型的程序语义不等价博弈
- A-3PO:利用感知陈旧性的近端策略近似加速异步大模型训练
- 在原生 FP4 硬件上使用 MXFP4 预训练大语言模型
- DORA Explorer:在无需训练的情况下提升大语言模型的探索能力
- CHORUS:高覆盖率测试平台激励生成的互补专家模型
- 可解码但不可拆卸:训练数据粒度决定大语言模型的参数模块化
- 利用结合语义站点嵌入的强化学习缓解公交车串车现象
- 大规模解释语言模型隐藏状态
- 面向无人机入侵检测的对话式与仪表盘式可解释AI:操作员信任与依赖性的实证研究
- 连续交互扩散:面向异步工具增强推理的扩散原生运行时
- 通过非局域性测量 SAE 特征的语义抽象度
- 思维链何时有效、何时失效:大模型推理中串行深度瓶颈的实证研究
- 假设前沿:验证器引导的大语言模型与符号搜索用于一阶归纳
- Comprendia:AI 增强的代码理解工具
- 个性化技能能帮助编程智能体吗?开发者交互历史的实证研究
- 基于角色条件设定的大模型信息检索评估评估员敏感性探针
- 这是你的最终答案吗?跨语境一致性作为大语言模型可信度的度量标准
- 状态关联并不能可靠预测决策泄漏
- OEIS Open:语言模型能将多少猜想转化为定理?
- 大规模有限集约束解码的字典树自动机
- 死文本还是约束条款?衡量与恢复黑盒大模型对话中的约束影响力
- 通过向外部大语言模型隐匿敏感信息实现保护隐私的检索增强生成(RAG)
- DMDIntel:通过动态模态分解解释大语言模型
- PROVE-RT:使用大语言模型为实时系统生成机械化定理证明脚本
- 罕见异常失效下的解释性参与:模型行为的渐进稀疏性(或:渐进式AI)
- 大语言模型中的数字能力:根本局限与改进路径
- StateBridge:大模型多智能体系统中无需训练的隐状态对齐潜在通信方法
- vToken:面向可回收 KV 缓存的Token级虚拟化技术
- 教授幅度而非方向:面向多轮多步LLM智能体的验证器有界信用分配
- 开源权重模型的行为重编程:认知可塑性与对齐边界
- 不求甚解的盲目模仿:大语言模型中决策偏差的根源
- QuoteBench:匹配分数如何掩盖命令路径失效
- SynAct:用于自适应综合优化的推理-行动大语言模型智能体
- PIPES:通过溯源与先验知识保障智能体感知安全
- 查询时机导致大语言模型与人类在位置偏差上的截然相反
- LigBench:面向基于大语言模型的科研构思生成的统一且人类对齐的基准
- 使用双角色标识符的生成式通用多模态检索
- 保留、定制还是退出:LLM推理服务中的默认设计与代币定价
- AaLLM:使用大语言模型实现从拓扑生成到尺寸优化的端到端模拟电路设计框架
- 训练混合:将小规模支架式预训练运行重新组合为更大的语言模型
- DFM Mimir v1:仅使用合规后训练数据、在10B参数量级实现前沿性能的开源HRM模型
- 揭露人工智能多智能体系统中的对话偏见
- AHD Agent:用于自动启发式设计的智能体强化学习
- 学习型多智能体系统的延迟感知编排
- 相似性贯穿始终:大语言模型的多语言泛化依赖于语言层面的相似性结构
- 大规模遗忘:数十亿参数语言模型中的状态精确且保留轨迹的删除
- CangjieBench:在低资源通用编程语言上评估大语言模型
- 没有通用信号能够预测版本更新下大语言模型的样本级性能退化
- 基于扩展假设在无标签情况下评估智能体学习框架能力
- 绝不返回具体数值:面向以事实形式消费答案的 AI 系统的结构性弃权
- 自主芯片设计中的智能体编排
- LLM预训练中领域数据重复策略的扩展规律
- 迈向高效的科技情报多模态多语言观点提取:基于 QLoRA 的微调方法
- BiasTrace:将推理行为与大语言模型的偏见输出联系起来
- 状态条件验证:用于适配与监控安全分类器的正确性估计
- 脓毒症治疗的依从性如何?用于生成临床依从性洞察的专家引导神经符号学流水线
- 面向大模型辅助模拟版图优化的仿真感知上下文策略改进
- 大语言模型无法实现科学认知的‘跨越’
- 基于图结构的强化学习框架:用于自主LLM智能体的结构化漂移诊断与恢复
- 并非所有 Token 都是平等的:面向智能体 LLM 系统的感知通胀路由
- 语言服务器能为编程智能体节省Token吗?测量方法与初步研究
- 代理验证的 LLM 用户体验微模拟:早期决策支持的构件优先协议
- 通过激活引导剪枝实现跨模型规模的无训练知识迁移
- CForce:通过一致性强迫提升扩散大语言模型的并行解码能力
- 放大并不意味着预测性:思考模型中的推理行为
- HAM-RAG:面向结构保真交错生成的层级感知多模态RAG
- 音乐之镜:大语言模型在词曲创作中充当共鸣板
- 用于模型合并的多目标贝叶斯优化
- MACS:用于可靠对话式电商推荐的混合多智能体框架
- LUNAR:基于通用用户行为日志的个性化大语言模型基准测试
- AI聊天机器人中的广告?大语言模型如何应对利益冲突分析
- 利用少样本学习与大语言模型分析科学文献中不同生物学性别的血压变化
- 利用大语言模型增强科学命名实体识别:一种类型驱动的多任务学习方法
- 多轮大模型推理的自适应停止策略
- AI智能体能够模拟A/B测试结果吗?智能体实验验证框架解析
- 预测性记忆定位:从内部信号预测选择性干预路径
- 大语言模型在医学推理中展现出元认知敏感性
- 无干净参考集的智能体数据清洗:能力与权衡的实验研究
- 同步 Logit 引导:现实世界中的隐写术
- 观点:科学团队中的AI智能体应作为人机系统进行研究
- 迈向安全的LLM智能体:规范、验证与执行综述
- 大语言模型知道该问什么以及何时发问吗?多轮信息搜寻能力评估
- MINT:用于平衡多目标对齐的最小选择偏好蒸馏
- 工具返回结果比纯文本更具权威性吗?基于 Claude Opus 5 针对合成赋值任务中虚假声明采纳的三项前瞻性研究
- 汇聚而非准入:注意力机制如何将潜在变量转化为可表述形式
- 机器智能的构成先验:人工物理世界的合法性理论
- ReForge:利用经过验证的大语言模型修改,让ABR算法持续演进永不过时
- 量化智能体剖析:代码合成智能体工作负载中的显存稳定性与预测
- MoE 路由引导的异构联邦指令微调聚类方法
- 分歧-收敛推理:通过结构化解决方案合成扩展测试期计算
- 面向小型设备的超大模型:边缘AI部署的近期进展与实证分析
- KV-Rescue:通过逐步交织恢复推理语言模型的KV缓存淘汰损失
- RAGas:结合持续知识集成的智能合约检索增强Gas优化方案
- ATLAS:基于嵌入引导质量多样性搜索的LLM无支架算法合成
- 亲爱的算法:用于统一搜索与推荐的注重精度优先的智能体意图层
- 上下文压缩给AI智能体带来了什么代价?被任务完成指标掩盖的交互成本
- 提示词的价值:一种大模型相对柯尔莫哥洛夫复杂度的方法
- 多模态生成式模糊系统:模糊推理引导的大模型交互式问答框架
- 前向传递域自适应(无需跨层反向传播)
- 自动还是受控?重复启动效应揭示了基础大模型、指令大模型与人类的思维处理分化
- 开放策略独裁者博弈:相互透明环境下的合作
- 长周期多智能体大模型商业环境中的涌现性错位通信
- 当AI重写,分类器放松:针对讽刺与AI释义社交文本的不确定性感知的正面/负面情绪分析
- MAPLE:MoE 自适应即插即用层级专家分配框架
- ETHOS:面向临床多智能体系统的模块化伦理框架
- MistyPilot:通过多智能体大模型技能编排实现社交机器人控制
- 当故事演进时:开放式世界模拟中大语言模型叙事能力的基准测试
- GraniKV:针对具有长共享前缀的多智能体系统的非对称粒度KV缓存分页
- Kozuchi Agent:用于软件修复的语言无关开源权重智能体
- CAPO:大语言模型智能体的约束感知提示词优化
- PertMind:通过细胞扰动数据强化学习激发大模型的涌现生物推理能力
- GxP-Agent:用于基于大语言模型智能体实现可靠临床试验编程的进程有向无环图拓扑
- SignalReasoner:评估3B模型在信号数学推理中的性能上限
- 面向忠实知识图谱推理的结构内化规则语言模型
- PlanPO:面向多轮智能体大语言模型的群组规划感知策略优化
- GraphWake:基于大模型智能体社区中记忆介导的极化级联效应引发群体极化
- 面向关键任务基础设施运营的LLM智能体任务感知约束适配
- 混合专家(MoE)模块包含强有力的幻觉检测信号
- 何时复习:语言模型持续预训练的间隔重复机制
- 通过程序搜索与持续抽象发现实现程序化内容元生成
- 大语言模型能解释飞行安全事件吗?一种先验引导的语义大模型方法
- LEGO-RL:面向代码智能体的原生基架强化学习
- 在安全调查中使用和评估大语言模型作为替代专家的框架:可靠性、偏见与影响
- 意图驱动的动态分块:基于预测信息需求的文档切分方法
- 超越可疑步骤:长程智能体的本体论信任
- 通过跨难度优化动力学理解大语言模型中的课程学习
- PTXBench:利用架构专用 PTX 评估与适配大语言模型以进行 GPU 核函数优化
- 探究预填充阶段:通过潜在激活检测代码漏洞
- 已编码但无法利用:冻结大语言模型中几何约束的“解码-生成-引导”鸿沟审计
- 评分需要的是评分标准,而非大模型的智能
- 为什么 GPT 风格模型无法直接迁移到符号音乐:错误坐标系下的压缩问题
- SIGMA:面向无元数据 LLM 自动特征工程的 SHAP 引导隐式轨迹生成
- 盲目的策展人:有偏见的评判者如何悄无声息地阻碍自进化智能体的技能淘汰
- 大模型引导的图生成方法用于基于结构的局部改进优化
- G-ReAct:基于结构-状态协同演化的图引导深度搜索
- Palmyra x6 技术报告:基于锚定监督微调的智能体与工具调用模型
- 人工智能语言表征中:虚假(Falsehood)与不可能(Impossibility)指向不同的方向
- 自进化智能体作为动态图变换:综述与新视角
- 衡量部分得分差距:越南2025年凸性评分方案的严格基准测试
- 治理记录作为监督:用于结构化工作流修复的验证器选择自训练
- 轻量级多模态模型能评估大语言模型的推理性能吗?面向计算最优文档推理的研究
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 自我与他人标签在LLM裁判中引发双向偏差
- 通过拒绝别名缓解消融攻击 (Abliteration Mitigation via Refusal Aliases)
- 言语过度自信的不同面相:一项可解释性研究
- 大语言模型无训练推理时自我反思与成本受限早停机制
- 大型语言模型中的机构声望与地理偏见:来自带有自助法置信区间的三个析因实验的证据
- 相同事实,不同更新:推理设置如何塑造大模型在医疗资源分配中的行为
- LLaMA 3.1 8B 中结构感知数值推理的机理可解释性研究
- 心理健康教育人工智能:用于自动化临床督导与风险分流的三流微调大模型框架
- 利用交互作用评估与解释大语言模型的提示词敏感性
- MLREF:利用大语言模型实现强化学习奖励设计的模块化高效重用
- 野外测试时扩展:为什么“开发”而非“探索”才是瓶颈
- rEDMRec:将大语言模型推理蒸馏为可编辑的推荐经验记忆
- 从威胁情报到检测:基于知识驱动增强与模板化规则落地的自动化 Sigma 规则生成
- 拦截袋鼠:基于人工词库、主动探查以及利用大语言模型作为信息提供者与假设提出者的实验性星际语言学
- 大语言模型用于Verilog代码生成:文献综述与未来之路
- S2-MoE:在边缘设备上实现高效的混合专家模型自推测解码
- MedStruct-S:面向OCR临床报告的键发现、键条件问答与半结构化提取基准
- 语言模型微调中的幽灵相变:密度矩阵分析
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- 基于目标侧阅读器适配的跨模型记忆迁移
- G-ReAct:通过结构-状态协同演化实现图引导的深度搜索
- AI 的十万个为什么:大语言模型的准确定性与“AI 垃圾内容”的指纹特征
- 什么是推理?
- Claude 如何为 AI 生成的文本添加水印
- 快节奏与硬核代码
- PrimeAgentOrchestrator:面向个人 AI 基础设施的记忆预加载智能体衍生系统
- 儿童的学习效率为何依然超越AI——至今仍是一个谜
- SAGE:SQL中AI函数的统一代数与自适应执行
- 终端智能体:命令行环境下的 AI 智能体综述
- VortexChat:用于自主多目标集成光子设计的智能体框架
- 已知而言:通过召回锚定蒸馏防止大语言模型监督微调中的事实访问失效
- RAG 亟需建立索引:为什么写入时编译优于查询时解释
- TRACE:基于多源证据溯源的代理式商品目录增强框架
- 科学声明能从大语言模型中移除吗?声明级遗忘的系统性评估
- CLEAR:用于保持模型效用的连续潜在适配器路由大模型安全对齐
- TreeWY:门控DeltaNet混合模型的投机验证
- 通过注意力头干预实现大语言模型中的个性化隐私控制
- 不要解决,只需比较:用于LLM智能体运行时干预的微型顾问
- 迈向自动化研究:利用具有范畴结构的论文知识图谱挖掘可证伪的研究构想
- 大型语言模型在疟疾药物发现中的严谨评估:性能、规模与资源效用的权衡
- 大语言模型何时能替代微调的 NLU?生产环境中意图检测的决策框架
- 当词汇理解失效于临床推理:评估治疗型聊天机器人针对Alpha世代的安全风险
- ARQ:用于C/C++漏洞检测的智能体CodeQL查询优化框架
- 结构化但脆弱:论大语言模型在网络安全决策中的局限性
- 目标感知的校准数据选择:在量化语言模型中保持不确定性
- HIERA:针对GPU内核优化的跨实现空间工作负载感知规划
- 感知量化修复:恢复压缩版 4-bit 大语言模型的实用方法论
- AgRefactor:用于高层次综合(HLS)兼容性与性能的自进化智能体工作流
- 大语言模型能够进行内省吗?一项现实检验
- 学会何时思考:用于测试时计算分配的自适应推理
- 通过查询覆盖率与声明可验证性实现与查询无关的 RAG 评估
- 用机械可解释性解释内在的道德自我修正
- CulTrace:追踪大语言模型内部的文化推理过程
- RefusalGuard:大语言模型中保持几何结构的安全性微调方法
- 基于偏好的自蒸馏:通过奖励正则化超越 KL 匹配
- INFUSER:影响引导的自我进化提升大模型推理能力
- DFM Mimir v1:仅使用合规后训练数据、在10亿参数规模下实现前沿性能的开源HRM模型
- 重要他人 AI:作为长期关系智能的身份、记忆与情绪调节
- 量化感知修复(QAH):一种超越全精度原型的压缩4比特模型
- 衡量大语言模型中的激活控制能力
- 让信用跟随计算:面向大语言模型强化学习的架构感知信用传递
- 乳腺癌多学科团队会议边缘AI医疗器械系统的开发与可行性评估
- HIRA:面向受监管行业文档分类的人机协同检索增强级联系统
- LLM4LLM:通过闭环智能体优化弥合内核基准与真实部署的差距
- DynaContext:异构参数提取中优化提示词的自改进动态上下文构建方法
- 小型推理模型在函数调用中即为指令遵循者
- 解决可解释人工智能中的选择问题
- HERO:用于长程智能体记忆的人类画像增强检索优化框架
- 大语言模型用于问卷文本分析:人类与 GPT-5 在归纳式内容分析上的性能比较
- 基于大语言模型的虚拟人言语与非言语行为不一致性选择
- DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习
- AgentWeave:在工具丰富的语言模型中,通过先路由后推理实现高效函数调用
- 特定领域大型语言模型在回答精神病学患者咨询中的表现
- 漫步黑暗面:使用 DARKSIDE 进行逻辑增强生成与连贯性审计
- SRPO:面向长视野推理的自反思策略优化
- 从超声报告提升 O-RADS 风险分层:混合推理与端到端大模型推理策略的比较评估
- 隐藏在请求之中:通过词元相关性解释不道德的大模型依从现象
- 智能体脚手架会放大大型语言模型的谄媚行为
- 权重中被遗忘,工具中被找回:大模型智能体的工具去学习
- 基于良性事实的强化学习会放大对已记忆隐私数据的泄露
- 架构作为代码Agent的能力均衡器
- HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化
- 语言模型中的评估意识:表征、言语化与控制
- Meta-Ctrl:通过解耦语法与语义约束实现有保证的计划生成
- EDGE:智能体强化学习中引导式探索的经验蒸馏框架
- 词汇扰动破坏大模型推理:注意力转移的实证研究
- 基于上下文学习预测漏洞严重性:一项工业级案例研究
- 针对未见问题的LLM评估:上下文多维项目反应理论模型
- 多语言大语言模型裁判中的排名反转现象:一种无标签的双中心化校准器
- DiaRelay:利用恒定大小内存进行对话情感识别的对话上下文传递机制
- 不要重复自己:在采样阶段制止逐字循环
- XTC:通过排除首选实现对头感知采样
- 面向黑盒大模型分类推理的层级感知监督不确定性估计
- 超越裁决:基于图结构的科学事实核查中人类与大语言模型推理过程分析
- SplitLite:用于拆分学习的低秩残差压缩技术
- Sigmoid Attention:构建学习型 KV 缓存淘汰的更优底层架构
- LoRA微调过程中公理化注意力模式带来的相关性涌现
- Muon优化器的物理响应与记忆模型
- 如何稳定且高效地训练评判模型(Critic)
- FIDES:大模型生成交易策略的一致性协议
- 知识图谱上的神经符号推理:基于查询视角的全景综述
- MACD:面向大语言模型的自学习知识多智能体临床诊断框架
- 超越基准:基于拟人化与生命周期导向的大模型评估路线图
- 自进化科学智能体发现可泛化的具物理推理能力流体控制策略
- CacheSpec:在大语言模型中为小模型寻找最佳平衡点
- NL2SHACL-Bench:自然语言转SHACL翻译的基准测试套件
- 基于分层语言模型的动态多字节预测
- 当熵不再足够:在大语言模型输出长度预测中找回丢失的语义
- 医疗大语言模型因果知识图谱接地框架:心血管领域试点研究
- 审视合成回忆录:对照真实生活记录评估大模型生成自传中的场景级胡言乱语
- 门控激活引导:减少医学问答中的谄媚现象与幻觉
- AgentRoom:基于CRDT共享工作空间的并发多智能体编程
- Minima-KV:采用混合格式分页注意力的保持保留型 KV 缓存压缩技术
- MARS:面向竞技编程的多专家大模型接力系统
- 大规模语言模型中通过偏好数据筛选减轻对齐税
- 基于约束引导的大语言模型企业数据映射
- MetaRAG:面向智能体RAG的信念-动作对齐策略优化
- 选择性再生解码:面向推理时推理的轨迹级干预
- 从状态到行动:用于可靠多轮工具调用的 OODA-Tool
- 食谱也有人格吗?属性化程序图中的创作者风格表征与生成
- 交接税:LLM 智能体中延续非原生轨迹的代价
- 大语言模型智能体的工具创建与使用联合优化
- 行动时刻的自信:隐藏信息下大语言模型博弈中的信念校准失误
- Meta\(^n\):通过涌现深度实现递归自我提升
- Parason:揭示大语言模型推理中的子任务与试验并行性
- 大规模测评中自动化题目偶然内容相似度分析的双维度大模型框架
- RACE:大语言模型神经元功能一致的可扩展统计估计
- 正确的诊断,装饰性的推理:医疗思维链的扰动审计
- CAFE:自我提升的搜索智能体需要共同进化的反馈
- TrustShiftProbe:MCP服务器分阶段信任攻击的特征分析、基准测试与防御
- 通过几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性
- 高效评分:面向低成本大模型作文评分的强盗算法驱动提示词选择框架
- 自信且错,悄无声息:端侧部署语言模型未遂故障审计
- 智能体何时应当停止?面向工具使用型大语言模型的证据携带式终止机制
- 名字也能伤人:定位本地编码大语言模型中因包名幻觉引发的投毒抢注风险
- 企业级MCP网关的混合语义工具发现:架构与实现
- 云模拟器的自动化综合
- 大模型引导的工业过程操作决策上下文动作评估
- Design-to-Plan:基于大语言模型的多元智能体框架,实现从3D CAD模型与2D工程图到制造工艺规划的自动化
- PARTAB:基于结构化证据和分区感知推理的可扩展表格理解
- 知道何时寻求帮助:分层LLM智能体中的贝叶斯自我升级
- FARCA:面向具有事实监督的强化学习的事实对齐可靠性感知信用分配
- 对比分支策略优化 (CBPO)
- 监督式不确定性量化集成何时能提升大模型幻觉检测能力?一项鲁棒性研究
- 面向人类与机器代理的文学化编程环境
- COCI:会议组织者与内容标识符
- RAT:用于RAG评估的统一贝叶斯模型
- 基于可验证奖励的同策略蒸馏 (OPDVR)
- ReflCtrl:通过表征工程高效控制大语言模型反思
- Quasar:专为大模型代码操作而设计的编程语言
- ADVERSA:衡量大语言模型中多轮护栏退化与判别器可靠性
- 大语言模型还能解释自己吗?量化对自解释影响的研究
- 单个神经元何时能修复大语言模型中的重复循环?
- Tournament-GRPO:面向开放式长文本生成强化学习的组内锦标赛奖励机制
- 超级智能检索代理:Agentic 检索的下一个前沿
- Eluna:用于自动化仓库运营的推理与任务执行智能体系统
- SaliMory:为对话智能体构建认知记忆系统
- LOCKS:用于高效长文本解码的页局紧凑键摘要
- 自进化科学智能体设计具备物理推理能力的白盒流体控制
- 最佳实践评判器优化 (BPCO)
- 不可见的编辑层:形式化定义已部署语言模型中未披露的推理时操控、概率布局与归因难题
- 朴素提示词优化:重新审视复杂提示词搜索的必要性
- GAMMA:任意预算下混合精度模型的全局比特分配
- 频率至关重要:用于剪枝与量化的快速模型无关数据筛选方法
- 放手让他们窃取:使用知识蜜罐拦截大语言模型提取攻击
- 大规模供应链运营中可靠的大模型驱动决策引擎:架构、安全与性能保证
- 潜在通信何时真正发挥作用?多智能体大模型中中继KV缓存的因果审计
- TriShieldRAG:检索增强生成分层防御中的三层护盾与盲区
- 自然语言输入、语义航迹表示与大模型推理:让海事信息交换模型变得可行
- FuzzingBrain-Bench V1:评估大语言模型的开放式漏洞发现能力
- 联邦化几乎免费,推理则不然:蛋白质表征工作流中 AI 联合科学家的权衡
- 大语言模型创造力自动评估的局限性
- 面向早期前原理图嵌入式系统设计的LLM驱动及数据手册感知自动化硬件兼容性验证
- FLARE:利用基于大语言模型的定理证明验证混合整数线性规划重构
- 位置与内容:解构大模型结构化输出中的结构与内容错误
- 使用大语言模型发现数据湖中的数据关系:一项工业级案例研究
- DEEPCHART:大语言模型距离实现忠实的数据科学图表生成还有多远?
- C-Unseen:利用大模型推理检测动态时序知识图谱中的弱信号
- 概念复杂的范围综述中人工与大语言模型筛选工作流评估:召回率-工作量权衡与运行一致性
- pro-team 参加 LLMs4OL 2026:基于检索增强生成与词汇受限过滤 本体学习方法
- 迷失于压缩:提取式提示词压缩器跨语言受控审计
- 当规范补全出错时:大语言模型中“跳跃”的形式化与度量
- 大语言模型长文本生成中大纲阶段的多框架对比研究
- DRL:面向模式图扩展的事务安全企业级 NL2SQL 确定性关系中间件层
- 关于作用域分类与当前知识编辑基准的负面结果:以INLAY作为无梯度案例研究
- Diff Mining:通过Logit差异揭示微调目标
- Behavior2Trip:基于用户行为轨迹迈向个性化旅行规划
- “不太可能”究竟有多不可能?评估大语言模型对概率词汇的感知
- 语言模型如何组织与构建道德知识
- 数字EDA中的大语言模型:从生成到编排的角色转变视角
- DeepPlanner:通过优势塑造扩展深度研究智能体的规划能力
- SWE-Prime:更少的轨迹,更优的性能
- 语言模型会遵循奥卡姆剃刀原理吗?归纳与溯因推理中的简约性评估
- 在高维事件序列中学习预测、发现与推理
- 大模型驱动的群集智能:新前沿还是概念延伸?
- FlavourBench:用于大语言模型评估与后训练的可执行烹饪奖励地图
- 基于错误代码驱动的测试用例合成与密集奖励塑造的稳健代码强化学习
- 从惯性走向客观:通过噪声隔离提升深度研究智能体的性能
- 超越端点收益:医疗专业化模型的权重差分审计
- HybridProver:通过大模型驱动的证明合成与精炼增强定理证明
- AirLLM:基于扩散策略的自适应 LoRA,用于大语言模型的无线远程微调
- 频率至关重要:用于剪枝与量化的快速模型无关数据筛选
- GAMMA:面向任意预算的混合精度模型全局位分配框架
- 放任盗取:利用知识蜜罐诱捕大语言模型提取攻击
- TriShieldRAG:检索增强生成分层防御中的三重防护网与一个盲点
- 大规模供应链运营中可靠的LLM驱动决策引擎:架构、安全性与性能保证
- 使用编码智能体进行自动研究:古兰经朗读数据上的泛化者与指标最大化者
- PhysElite:大模型距离解决奥赛级物理题还有多远?
- 联邦几乎零成本,推理则不然:蛋白质表征工作流中AI联合科学家的权衡
- FLARE:利用基于大语言模型的定理证明验证 MILP 重构
- 面向嵌入式系统早期原理图设计阶段的LLM驱动、数据表感知型自动化硬件兼容性验证
- 自然语言输入、语义轨迹表示与大模型推理:让海事信息交换模型变得易于实现
- 大模型增强的因果发现:边存在性与方向性的概率融合
- SABER:基于对抗分支探测的大语言模型推理稳定性感知早退机制
- 思考消耗Token:何时更复杂的结构才物有所值
- 保持在边界内:基于距离引导解码的保证上下文无关文法合规性
- 从文档到推理:面向金融数值推理的验证型合成数据流水线与语义感知微调
- 投机探测:以投机解码成本实现大模型监控
- VERA-8B:基于SEC备案文件的证据溯源审计风险推理模型
- 学习使用工具:用于工具集成数学推理的强化学习
- PACE:基于智能体自动化的发布者自适应内容提取
- 选择而非训练:基于大模型选择器的模块化实体消歧的优势
- 大语言模型中的量化触发式后门:跨量化器可迁移性与验证-部署鸿沟
- 先实现可玩,再追求优秀:面向小型对话游戏智能体的分阶段交互学习方法
- OpenStamp:面向开源语言模型的水印技术
- 大型视觉语言模型中用于缓解幻觉的动态对齐补偿方法
- KV缓存淘汰的概率解释
- 保真度远远不够:面向智能体数据表提取的调度级插桩技术
- 超越置信度:通过检索扎根实现多信任搜索智能体的测试时扩展
- Think-at-Hard:用于提升推理能力的动态循环 Transformer
- PRISM:基于大语言模型的智能体检索多跳问答系统
- 为什么所有大语言模型都对日本文化“情有独钟”?解析大模型中隐藏的文化与地域偏见
- 语言模型评分细则引导强化学习综述
- 更具表达力的前馈层:第一部分. 激活函数的Token自适应混合
- 激活引导的信号来源:激活引导中的激活源选择
- 微小体量,巨大影响:大型语言模型中的缩放向量研究
- 土耳其语 RAG 系统分块与嵌入策略的对比研究
- Logos:基于跨进程总线的智能体运行框架
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 自发欺骗与受指令欺骗中的不对称性
- 大语言模型中的长视界状态追踪:通过深度依赖工具调用链执行MD5
- 摆脱冗余推理:面向推理阶段大语言模型的结构感知搜索
- 市场目录的自动研究:从传统表单到AI原生匹配
- 一种策略,适应任意预算:通过强化学习内化预算感知搜索
- SOVER:通过大模型辅助的SMT验证实现优化问题重构的形式化认证
- 强化学习增强的大语言模型智能体求解复杂车辆路径问题
- 精修却未决:识别长程工具使用智能体中的后期压力状态
- CacheBridge:高效的跨模型 KV 缓存传输
- Harness-of-Harness:实现具备持续改进能力的多天自主软件开发
- 潜在循环思考:基于冻结大语言模型的连续隐空间循环精炼推理
- AutoXRD:用于粉末衍射分析的自主大模型智能体与综合评测
- 当护栏看似有效时:LLM智能体商业评估中的构念效度失效
- 从检测到拒绝:通过电路引导的权重缩放构建更安全的大语言模型
- 廉价验证器与巨大的盲区:衡量降本级联的可靠性代价
- 检索、打分与解码方式对基于大语言模型的对话式推荐系统性能与稳定性的影响
- OCGQuant:面向 NVFP4 量化的异常值伴随分组法
- 比 Flash 更快:利用注意力稀疏性实现高效的长文本解码
- QTEA:基于稀疏残差显著权重与按列优化的三值大语言模型
- 通过激活匹配微调检测大语言模型中的隐藏行为
- 使用大语言模型与编程语言语义预测程序退出代码
- 坦白你所知:大语言模型遗忘中“遗忘集与模型知识错位”问题研究
- 智能体程序:计算材料科学中一种新兴的科学软件形态
- 通用语假设:大语言模型通过潜在的、与任务无关的特征空间进行翻译
- 用记忆替代训练:Text-to-SQL 的列表式选择方法
- 上下文对齐增益由预存在机制介导:GRPO、SFT与DPO的审计分析
- 滞后耦合:内部表示在具备因果效力之前就已经可读
- CordisBench:语言模型能否在动态智能体运行框架中进行组件生命周期推理?
- 基于大语言模型程序合成的组合式机械设计
- 面向上下文密集型任务的 KV 缓存卸载技术
- 一个Token抵一千个:通过低 rank 克隆实现高效知识蒸馏
- 为什么微调会加剧幻觉以及如何解决
- 智能体强化学习中的技能复用与压缩
- 揭示大语言模型中类人表征的计算要素
- 照我说的做,别学我做的:大语言模型中的指令-归纳冲突
- HeadWiseKV:混合长上下文语言模型的按头预算化缓存驻留机制
- Qwen3-4B 后训练三值化:能力、有效比特预算、存储压缩与部署
- 大语言模型中的“拆屋效应”请求与拒绝行为
- 匹配器裁决:威胁报告知识图谱提取的可复现性审计
- 在线蒸馏相遇离线GRPO:训练紧凑型指令遵循重排器
- 面向行业标准电网信息与交换模型问答的种子锚定预算受限图渲染
- 可扩展的克罗内克-费雪近似:针对十亿参数语言模型压缩的高效黑塞矩阵分析
- 使用大语言模型在智能合约中进行自动化漏洞注入
- 后训练语言模型在编程竞赛中实现金牌表现
- 语言模型能够自主控制注意力
- FormalEvolve:用于多样化自动形式化的神经符号演化搜索
- 衡量大语言模型中的推理质量:多维度行为框架
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- LivingArena:大模型知道其他大模型不知道的吗?作为可扩展评估的同伴探测技术
- 超越RAG:实时对话中的问题识别与答案生成
- 基于大语言模型的自适应岛屿图演化自动特征工程
- 每次都能完美掌控十七:企业数据分析的受控方法
- 通用型AI助教中构建可扩展、灵活且实时的混合微观个性化提示工程方法
- Dude:用于论文与代码差异检测的双重检测多智能体系统
- 陷于故事:多轮大语言模型对话中的叙事捕获现象
- GrowPage:用于高效大模型推理服务的按需 KV 预算管理
- 药物毒性预测中提示词工程的分析研究
- 激进解码期 KV 淘汰的关键要素:时间聚合与排序保持
- Dalek:构建式智能体机器
- HalluPeer:用于检测科学同行评审中幻觉的分类法驱动基准
- SimSkill:用于自主掌握交通模拟的终身学习AI智能体
- 主动式服务智能体:统一的决策框架、方法与评估
- 适应不断演变的需求:用于零售供应链运营的智能体化 AI
- 更多的批评并不等于更好的审稿:EquiReview-R
- 替我发言:赋予大语言模型参与会议的情境感知能力
- STAIR (结构感知信息检索器):用于文档结构增强的新型数据集与大模型检索器
- 为什么门控DeltaNet能在4位量化下存活:混合27B大模型循环部分的NVFP4 W4A4技术解析
- FLY-EVAL++:面向大语言模型安全约束飞行预测的证据驱动评估协议
- GRPO中隐藏的虚假优势
- 指令复制作为推理时控制基元
- 倾听潜变量:通过大音频语言模型中的隐状态交互实现自纠错语音识别
- Reflect-SQL:基于自我反思的 Text-to-SQL 框架
- 当优化演变为操纵:防御针对生成式搜索的恶意生成引擎优化
- 清洁工程,不稳定测量:黑盒大语言模型观察者在共享端点上预注册的可靠性失效
- TabScope:面向表格问答的问题自适应范围选择
- 是问题本身,而非路径:大模型推理轨迹中的预算与难度混淆
- 继承式智能体记忆预算验证中的计划指针与记录指令形式
- 当用户不再主动提问:对话式智能体中上下文驱动记忆检索的基准评测
</think>无法停止推理:虚假思维链终止现象分析- 表征对齐带来语言模型中具泛化能力的安全性
- 顺序优于联合:探索策略内蒸馏与RLVR之间的相互作用
- 语法对齐解码:保证结构化生成的正确性与概率保真度
- NeuroWeaver:用于探索脑电图分析管道程序化空间的自主进化智能体
- 解码前拒绝:检测与利用大语言模型中间激活中的拒绝信号
- 审计多智能体大模型推理树:性能超越多数投票与LLM作为裁判
- CoMAP:用于大语言模型智能体的世界模型与智能体策略共同演化框架
- SENTINEL-RL:将拓扑推理从安全运营中心(SOC)的LLM智能体中剥离
- 学会选择而非重新学习:基于硬路由推理 LoRA 混合模型
- LDC:通过动态控制生成研究构想的学习框架
- 人类心理测量问卷错误表征了大语言模型的行为
- 在开源大语言模型中读取与调控材料科学机制的表征
- 大语言模型时代的医学推理:增强技术与应用系统的全面综述
- 关系线性度是大模型幻觉的预测指标
- F-GRPO:别让你的策略只学显而易见的常识,而遗忘那些稀缺的解
- 结构化忠实:面向多文档摘要的声明锚定归因方法
- 重复不匹配:为什么数据配比实验无法扩展以及如何解决它们
- 科学智能体技能:面向研究智能体的程序化知识库
- 思维链失效时,解法隐藏在隐状态中
- PerfReasoning:大语言模型在硬件性能推理上的表现究竟如何?
- SQL-Zero:自我进化的 Text-to-SQL
- IPGeoAI:基于Transformer与大语言模型语义融合的IP地理定位技术
- 大语言模型引导的圆堆积程序演化:花费 28 美元打破 10 项 Packomania 纪录
- 从语言模型到世界行动系统:智能体AI在数字、社交、虚拟与物理环境中的进展与局限
- AutoLR:实现工业级推荐系统中从研究到上线评审的自动化
- ACE:基于MoE的大语言模型自适应免校准专家跳过技术
- 别放弃Dropout:优化层稀疏性以实现高效的LLM训练与推理
- 韩国开源公共API的多步工具调用:基准测试与数据合成配方
- 基于二元决策图的大模型驱动量子电路综合算法设计
- 大语言模型中的证据整合机制
- 通过贝叶斯视角统一 ICL、SFT 与 KL 正则化强化学习
- 大型语言模型中的文化不对齐:检测、度量与通过定向微调进行缓解
- 在细粒度混合专家模型中免训练将激活专家减半
- 激活引导能否捕捉多维度的作者风格?
- 无需拒绝的拒绝:安全微调响应的结构化分析与大语言模型误拒率的降低
- 历史即检测器:端到端执行CVE补丁历史
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- OR-Agent:连接演化搜索与结构化研究,实现自动化启发式设计
- 廉价验证器,巨大的盲区:衡量降本级联架构的可靠性成本
- 智能体上下文破解:通过非结构化数据的自适应构建实现Token高效的数据推理智能体
- SoK:AI 增强型二进制逆向工程知识系统化研究
- 构造即可归因:面向多文档摘要的声明锚定溯源
- SPD:生成式重排的单次前向传递解码方法
- 保护性能力幻觉:当大语言模型声称拥有不存在的能力
- 陷入疯狂的递归:当AI不断吞噬自己的输出
- 记忆究竟何时有用?工具调用大语言模型智能体中长期记忆的成本感知评估
- 大语言模型交易智能体在生产环境中的实际表现:来自两个机群的长达六个月、群体规模的实录
- LLM因果先验何时以及为何有效:面向摊销因果推断的闭环先验选择
- 大语言模型中战略选择的内部解剖
- 语言模型中的信念与行为
- 量化放大确定性而非偏见:服务时权重压缩的尺度依赖行为效应
- 通过基于SAE的引导解决知识冲突的关键路径识别
- 已被撤销却依然具备权威性:对智能体记忆系统中撤销执行情况的实证研究
- SRPO:多智能体大语言模型的集合相对策略优化
- 差异补丁 vs. 整体文件:Flutter/Dart 代码模型迭代编辑式与直接生成式的实证比较
- 面向长上下文大模型解码中密集片上NVM的接口感知KV缓存量化
- 大语言模型是否在“自食其言”:多轮交互中的因果历史效应
- 全为了1比特:迈向大语言模型真正的1比特训练后量化
- Scratchy:基于视觉草稿板的多模态推理在EasyCrypt密码学证明生成中的应用
- 面向智能体网络的类型化联邦构件:在冻结的异构LLM智能体间共享工具路由知识
- 动态路由器需要记忆吗?HeRo:面向高效大模型推理的历史感知路由机制
- FreqBLiMP:频率受控的最小对立集揭示了大语言模型在词汇稀缺性下的稳健性与脆弱性
- 超全训练,紧凑部署:扩展结构化大语言模型剪枝的恢复能力
- 重新编译远远不够:测试引导的反编译C代码修复
- steering 干扰反映了模型的默认倾向,而非行为方向本身
- 超越单一负样本偏好:面向大模型历史实体链接的多负样本 DPO 方法
- 从引用到贡献:大模型辅助的研究论文贡献度评分
- 准确率并非全部:基于散度的方法评估量化大语言模型的保真度损失
- AI 模型如何管理认知权威:针对用户异议回应的分类法与比较分析
- 你无法偏好未曾采样的情感:DPO微调大语言模型中的强度不足现象
- MOSAIC:用于跨范式智能体混合与人机协作的通用智能体级接口
- 扩展 Raschka 的 GPT-2:在 RTX 3090 上从头训练专家混合(MoE)模型
- Harbor Adapters与Harbor-Index:大规模智能体评估的基础设施与精选元数据集
- 递归语言模型训练中的脆弱性图谱
- FastE:基于读出触发的 LLM 嵌入推理 Token 压缩算法
- LOCUS:面向高 Token 效率语言生成的任务感知低秩训练后优化
- REAL-Q:基于动态梯度下降的端到端大语言模型量化
- LLM 如何遵循指令:多项语言技能的熟练协调,而非通用机制
- HISA:面向细粒度稀疏注意力的高效分层索引机制
- 解构 EGGROLL:大规模低秩进化策略的理论理解与改进
- 大语言模型中的知识归因探测研究
- 就绪与下发解耦:面向智能体大模型工作流的长尾感知调度
- DCO:基于预测性管理的面向大模型加速器动态缓存编排
- 几乎零开销的状态-预测解耦架构
- UltraQuant:面向重度上下文智能体的 4-bit KV Cache 压缩技术
- AsyncFlow:面向高效大模型后训练的异步流式强化学习框架
- 突破 1.58 比特极限:三值大语言模型的极致压缩与加速
- 元认知引导:学习科学判断的内在结构
大语言模型代理
大语言模型优化
大语言模型安全
大语言模型微调
大语言模型推理
大语言模型智能体
- EnvACE:通过世界彩排将环境动力学内化用于智能体强化学习
- 基于大语言模型智能体及列间约束发现的约束感知合成表格数据生成
- 综合特征提取器:用于算法选择的智能体方法
- NiyamAI:基于零知识证明的具备密码学可验证护栏的意图绑定型AI智能体
大语言模型训练
大语言模型评估
- 法律检索增强生成(RAG)系统的幻觉问题究竟有多严重?
- Wazobia Eval:尼日利亚皮钦语情感理解、讽刺检测与文化推理基准
- 使用经过验证的任务覆盖率评估大语言模型的多次生成能力
- PHMForge:通过基于 MCP 原生、算法扎根的工具评估大模型智能体在工业预测与健康管理(PHM)中的表现
- RealSWE:真实用户请求下编码智能体的组合式评估
- SHELF:用于多任务书目基准测试的合成评估框架
- 通过论证分析衡量人工智能问责制:模型的推理经得起推敲吗?
大语言模型评测
天体力学
天体物理学
天文巡天
天气预报
太阳系外行星
太阳系外行星搜寻
失败归因
奇异值分解
奇技淫巧
奎因翻译不确定性
奖励作弊
奖励函数设计
奖励塑造
奖励对齐
奖励建模
奖励攻击
奖励机制
奖励模型
奖励正则化
奖励规约
奖励设计
奥卡姆剃刀
奥数几何
委员会选举
姿态估计
威胁分析
威胁建模
威胁情报
子句学习
子模块
子空间几何
字典树自动机
字节级模型
存算分离
孟加拉语
孤立森林
学习分析
学习增强算法
学术影响力
学术知识图谱
学术研究
学术综述
学生参与度
安全
安全上下文
安全代理
安全关键系统
安全分析
安全分类器
安全合规
安全基准
安全审计
安全对抗
安全对齐
- CASA:基于安全注意力增强分类的鲁棒多模态对齐
- 能力不等于倾向:测量公民大模型智能体中抗压协作行为
- 定位安全对齐:大语言模型中MLP层与网络中部模块编码拒绝行为
- 愚人金:针对开源模型去安全化攻击的防御性欺骗策略
- 上游决策,滞后执行:定位并评估多语言混合专家模型(MoE)的跨语言拒绝回路
- 超越文本记录:检测潜在多智能体通信中的隐蔽协同
- 超越Token位置:扩散语言模型中跨去噪步骤的安全对齐
- 无需拒绝的拒绝:安全微调响应的结构化分析与大语言模型误拒率的降低
安全性
- 所有大语言模型都能感知自身是否在输出有害内容吗?针对模型家族潜在空间安全探测器的可复现性研究
- 威胁引导的策略感知场景扰动:基于在线强化学习的安全自动驾驶
- 语言模型中的评估意识:表征、言语化与控制
- TrustShiftProbe:MCP服务器分阶段信任攻击的特征分析、基准测试与防御
- Git 子模块作为包管理器
- 保护性能力幻觉:当大语言模型声称拥有不存在的能力
安全意识表征迁移
安全扫描
安全护栏
- ADVERSA:衡量大语言模型中多轮护栏退化与判别器可靠性
- LongGuard:安全护栏长文本失效的机理分析与免训练缓解方案
- LongGuard:安全护栏长上下文失效的机理分析与免训练缓解策略
- 基于隐式推理的强大且高效的安全护栏
安全授权
安全攻击
安全检测
安全沙箱
安全漏洞
安全研究
安全神经元
安全规划
安全计算
安全认证
安全评估
安全评判器
安全过滤
安全运营中心
安全配置
安全防御
安全防护
安全风险
完全混叠
定性推理
定性研究
定理证明
- PROVE-RT:使用大语言模型为实时系统生成机械化定理证明脚本
- HybridProver:通过大模型驱动的证明合成与精炼增强定理证明
- FormalEvolve:用于多样化自动形式化的神经符号演化搜索
实体匹配
实体消歧
实体类型验证
实体链接
实时优化
实时协作
实时叙述
实时对话
实时应用
实时拥堵规避
实时控制室
实时查询处理
实时生成
实时生成式音乐
实时系统
实时追踪
实证研究
- 智能体技能也可能带来负面影响:大模型智能体中技能引发故障的实证研究
- 个性化技能能帮助编程智能体吗?开发者交互历史的实证研究
- 智能体插件的维护与共演化:Claude Code 插件市场的实证研究
- 大语言模型交易智能体在生产环境中的实际表现:来自两个机群的长达六个月、群体规模的实录
实际因果性
实验保真度
实验偏差
实验室自动化
实验研究
- 罕见异常失效下的解释性参与:模型行为的渐进稀疏性(或:渐进式AI)
- 无干净参考集的智能体数据清洗:能力与权衡的实验研究
- 测出的AI偏好中,模型占几何,测量工具又占几何?
- 多智能体金融顾问中的检索增强生成与确定性税务计算:一项 2x2 析因实验
- 继承式智能体记忆预算验证中的计划指针与记录指令形式
实验科学
实验设计
实验追踪
审计日志
审计框架
审计系统
审计能力
审计风险
客户端聚类
客服中心
家禽养殖
容器安全
容量分配
容错控制
容错机制
容错计算
密度保持
密度泛函理论
- 域门控潜在扩散:基于第一性原理验证的 HMX 级含能材料生成式逆向设计
- DREAMS:基于密度泛函理论的智能材料仿真研究引擎
- 从实验与模拟的不一致中发现物理机制
- 利用神经算子学习 Kohn-Sham 映射以实现准线性标度的密度泛函理论
密度矩阵
密码分析
密码子优化
密码学
密码学与安全
密码学回执
密码学安全
密码学护栏
密码学证明
密码学隔离
密码学验证
对偶空间
对地观测
对抗性强化学习
对抗性探针
对抗性攻击
- 用一张纸劫持机器人:VLM控制机器人中物理提示词注入的系统性研究
- 学会说服暴露了大模型轻易放弃正确信念的弱点
- 打破假设:针对语义攻击对输入侧越狱防御机制的审计
- 分层大模型防御作为集成体系:访问层级、推理成本与防御层之间经测量的失效相关性
对抗性测试
对抗性评估
对抗探测
对抗攻击
- GRM:通过梯度比率掩码对音频大模型实施兼顾效用的越狱攻击
- 多模态大语言模型不断演进的安全格局:新兴威胁与防御综述
- 针对深度 OCR 系统的对抗性攻击
- 基于多任务一致性的对抗攻击检测
- SegPAR:面向语义分割的以类别为中心的基于决策的稀疏攻击
- 大语言模型赋能的社交媒体机器人检测系统的攻击与防御
- CIVA:针对视觉世界模型智能体的评论者诱导价值子空间攻击
- TriShieldRAG:检索增强生成分层防御中的三层护盾与盲区
- TriShieldRAG:检索增强生成分层防御中的三重防护网与一个盲点
- 从检测到拒绝:通过电路引导的权重缩放构建更安全的大语言模型
对抗训练
对抗防御
对抗鲁棒性
- 拟阵上泊松过程次模最大化的对抗鲁棒性:从鲁棒离线优化到全强盗学习
- 学习不该学的内容:用于鲁棒视觉-语言模型的对抗解耦提示微调
- 为什么鲁棒性会减少叠加?
- FraudBench:金融风险评估中对抗鲁棒性的协议敏感型基准测试
- 针对基于Mamba语言模型的隐藏状态投毒攻击
- 表征对齐带来语言模型中具泛化能力的安全性
对比学习
- InsightEmb:学习用于智能体洞察检索的动作-意图嵌入
- VLM2Rec:解决多模态序列推荐中视觉-语言模型嵌入器的模态崩溃问题
- DomusFM:用于智能家居基于事件行为监测的基础模型
- 无需高斯假设:面向 JEPA 世界模型的对比逆动力学
- MorphoGP:预测潮汐影响下平衡海滩剖面的非参数框架
- DELOS:用于Kepler光变曲线低信噪比盲搜的对比深度学习方法
- 从非侵入式脑电记录中解码感知语音的跨受试者泛化能力
- MIMO:通过单语目标实现多语言信息检索
- ARC-CT:面向3D胸部CT的解剖路径对比视觉语言学习
- 当特征成为样本:用于无监督特征选择的倒置对比学习
- ViTAMINS:利用合成难负样本训练自监督视觉Transformer的实证研究
- 小型Transformer中用于对比代码表示学习的合成语义监督:一项实证研究
- PrivateHub:用于私密传感器密集型环境数据生成的对比扩散模型
- 超越单次扩展:面向多跳检索的对比证据探索
对比解码
对比解释
对称性
对称性破缺
对话AI
对话分析
对话动态
对话历史
对话建模
对话式AI
对话式推荐
对话式推荐系统
对话情感识别
对话智能体
对话游戏
对话系统
- 分数衰减 KV 缓存:面向对话系统推理相关性优化的所有权感知内存管理
- DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习
- 面向目标导向对话编排的可审计符号-RAG-生成式AI架构
- PACE:面向 QoE 高效的检索增强对话服务的感知延迟自适应级联服务路由与填充词控制
对象存储
对象幻觉
对齐与优化
对齐技术
对齐漏洞
对齐研究
对齐税
导数感知算子学习
导管导丝分割
导管追踪
射线追踪
小型Transformer
小型语言模型
- 从零构建一个AI文本检测器:涵盖数据集构建、模型训练、本地部署与RLVR
- 通过SLM与边缘计算增强虚拟智能体:思考与记忆过程的探索性评估
- Wiola 13M:面向参数高效小型语言模型的门控螺旋注意力架构
- 适得其反的反馈:为什么小型语言模型智能体总是重复刚目睹失败的函数调用
- 一个Token抵一千个:通过低 rank 克隆实现高效知识蒸馏
- DeepAffinity:利用小型语言模型预测电子商务中的长期商品属性偏好
小波卷积
小米
少样本学习
尼日利亚皮钦语
局部学习
局部搜索
局部曲率
层剪枝
层次分析法
层次化建模
层次化推理模型
层次化架构
层次聚类
层级感知
层级相关性传播
屏幕活动
属性测试
嵌入优化
嵌入式
嵌入式AI
嵌入式开发
- 如何让初代 Steam Deck 液晶屏在树莓派上完美运行
- 精美的指针式伏特表时钟
- 在现实中还原康威生命游戏:硬件极客打造实体触觉沙盒
- 在 NTP 诞生之前:Daytime 与 Time 协议的前世今生
嵌入式系统
嵌入推理
嵌入模型
- 使用 Sentence Transformers 构建多模态嵌入与重排模型
- Granite Embedding Multilingual R2:开源 Apache 2.0 多语言嵌入模型,支持 32K 上下文——百兆参数以下最佳检索质量
- 使用 Sentence Transformers 训练和微调多模态嵌入与重排模型
- 前沿大语言模型能否匹敌原生多模态嵌入?硬负例文本到图像检索的对比研究
- MIMO:通过单语目标实现多语言信息检索
- 土耳其语RAG系统中分块与嵌入策略的对比研究
- 土耳其语 RAG 系统分块与嵌入策略的对比研究
- ExecRetrieval:衡量代码嵌入检索中的功能正确性差距
- Perplexity 详解其 GPU 嵌入技术栈:Ivy、Tulip 和 ROSE 如何支撑 pplx-embed
嵌入演化距离
嵌入空间
嵌入表示
嵌套学习
工业AI
工业因果推理
工业应用
工业总线
工业智能体
工业测量
工业物联网
工业界实践
工业自动化
工业过程控制
工作流优化
工作流修复
工作流引擎
工作流验证
工作空间
工作负载分析
工作负载感知
工作量证明
工具使用
- 智能体记忆蒸馏:利用分层教师记忆赋能小型大语言模型智能体
- 超越单轮置信度:LLM 智能体的轨迹自适应不确定性量化
- 教授幅度而非方向:面向多轮多步LLM智能体的验证器有界信用分配
- 面向工具使用型大模型智能体的完全循环子任务图:长程工作流中的灵活性、成本与瓶颈
- AgentWeave:在工具丰富的语言模型中,通过先路由后推理实现高效函数调用
- 权重中被遗忘,工具中被找回:大模型智能体的工具去学习
- 智能体何时应当停止?面向工具使用型大语言模型的证据携带式终止机制
工具编排
工具调用
- EnvACE:通过世界彩排将环境动力学内化用于智能体强化学习
- 调用还是不调用:评估与优化大语言模型工具调用的框架
- MCP 中的大语言模型至关重要:衡量由大语言模型驱动的低效资源利用
- 作为连续流的工具:演进式智能体推理
- 工具返回结果比纯文本更具权威性吗?基于 Claude Opus 5 针对合成赋值任务中虚假声明采纳的三项前瞻性研究
- Palmyra x6 技术报告:基于锚定监督微调的智能体与工具调用模型
- 从状态到行动:用于可靠多轮工具调用的 OODA-Tool
- 大语言模型智能体的工具创建与使用联合优化
- Quasar:专为大模型代码操作而设计的编程语言
- 学习使用工具:用于工具集成数学推理的强化学习
- 保真度远远不够:面向智能体数据表提取的调度级插桩技术
- 精修却未决:识别长程工具使用智能体中的后期压力状态
- 用于加速工具使用型智能体的推测性宏指令提交(Speculative Macro Commit)
- 接口诱导的轨迹审查:AI智能体评测中的静默失效
- 韩国开源公共API的多步工具调用:基准测试与数据合成配方
- 超越提示词:大语言模型工具智能体外挂框架的度量与优化
- 直接问工具,别瞎猜:智能体工具调用自带运行进度,推理系统理应主动读取
工具调用评测
工具路由
- Nexus:面向统一内存中智能体大语言模型的深度自适应 KV 缓存拼接与检索解耦工具路由
- SchemaRouter:面向高效异构智能体 RAG 的字段感知工具路由
- 面向智能体网络的类型化联邦构件:在冻结的异构LLM智能体间共享工具路由知识
工具集成推理
工艺工程
差异偏移检测
差异检测
巴拿赫空间
市场微观结构
布卢姆分类法
布尔可满足性
布尔查询
布局分析
希尔伯特空间
平台转型
平均场理论
平均负载
年龄估计
并发
并发服务器
并发编程
并行策略
并行解码
并行计算
幻觉
幻觉减少
幻觉抑制
幻觉控制
幻觉检测
- INTRYGUE:基于归纳感知的熵门控机制实现可靠的RAG不确定性估计
- 混合专家(MoE)模块包含强有力的幻觉检测信号
- BEAR-Bench:面向多模态模型的双语企业与学术推理基准
- 名字也能伤人:定位本地编码大语言模型中因包名幻觉引发的投毒抢注风险
- 监督式不确定性量化集成何时能提升大模型幻觉检测能力?一项鲁棒性研究
- 自信地出错且悄无声息:对已部署端侧语言模型不可检测故障的审计
- DEEPCHART:大语言模型距离实现忠实的数据科学图表生成还有多远?
- HalluPeer:用于检测科学同行评审中幻觉的分类法驱动基准
- CodeTD:注意力拓扑结构检测代码大语言模型中的幻觉
幻觉现象
幻觉缓解
- 利用智能体AI、嵌套学习以及通过语义缓存实现AI可持续性来缓解幻觉问题
- FARCA:面向具有事实监督的强化学习的事实对齐可靠性感知信用分配
- CounterVid:用于缓解视频-语言模型中动作与时间幻觉的反事实视频生成
- 构造即可归因:面向多文档摘要的声明锚定溯源
- 大语言模型中的知识归因探测研究
幻觉评估
幻觉雪球效应
幽默偏好
广义相对论
广义类别发现
广告投放
序列决策
序列分类
序列建模
序列标注
序列检索
序列模型
序贯蒙特卡洛
库学习
应急调度
应激检测
应用数学
底层感知
底层系统
度量空间
康威猜想
康威生命游戏
延迟优化
- 模型路由看似简单,实则不然
- Data API 路由至最近的只读副本
- Ready Cohorts:LLM 智能体控制中的 GPU 机会边界与主机往返优化
- 学习型多智能体系统的延迟感知编排
- 用于加速工具使用型智能体的推测性宏指令提交(Speculative Macro Commit)
- PACE:面向 QoE 高效的检索增强对话服务的感知延迟自适应级联服务路由与填充词控制
延迟归因
开发工作流
开发者工具
开放世界感知
开放世界模拟
开放世界视觉
开放式优化
开放策略
开放词汇分割
开放词汇表变化检测
开源
- Compiler Explorer 2026 年 AWS 架构与运行内幕
- Granite Embedding Multilingual R2:开源 Apache 2.0 多语言嵌入模型,支持 32K 上下文——百兆参数以下最佳检索质量
- 小米 MiLM Plus 发布 PROVE:面向感知对齐的对象移除评估指标
开源AI
- 仅需 165 美元,跨越 25 个物种训练 mRNA 语言模型
- DFM Mimir v1:仅使用合规后训练数据、在10B参数量级实现前沿性能的开源HRM模型
- 眼见为实还是先入为主:评估开源多模态大语言模型在反直觉场景中的语言偏见
开源大模型
开源安全
开源工具
开源数据
开源数据库
开源权重
开源框架
开源模型
- 它够具智能体特性吗?在自有工具上对开源模型进行基准测试
- 开源权重模型在金融文本理解领域能否与闭源模型一较高下?
- 愚人金:针对开源模型去安全化攻击的防御性欺骗策略
- DFM Mimir v1:仅使用合规后训练数据、在10亿参数规模下实现前沿性能的开源HRM模型
- OpenStamp:面向开源语言模型的水印技术
- DeepSeek AI 发布 DeepSeek-V4.1-Flash:支持 1M 上下文、FP4 KV 缓存与跨层注意力复用
- Linkup 发布 SPARSEUP:仅 149M 参数的开源最强稀疏嵌入模型
开源治理
开源硬件
开源软件
开源项目
异常检测
- 基于Volve油田的基础井况异常检测:构建标签、基线模型与双头模型
- 基于可微分D-vine Copula的局部化异常检测
- 基于敏感度建模的开放世界语义分割
- 罕见异常失效下的解释性参与:模型行为的渐进稀疏性(或:渐进式AI)
- 由表及里、由远及微:基于贝叶斯推理引导的聚焦式 VLM 推理的高速公路监控视频高效远距离异常检测
- 面向持久化机器监测的低功耗神经形态声学异常检测
- 有什么玄机?评估视觉-语言模型中的时间一致性
- 陷阱何在?评估视觉-语言模型的时间一致性
- 见证者解释异常:WAND——具备原生可解释性的无监督表格异常检测器
- 数值数据可解释异常检测的可微区间瓶颈
异构内存
异构多模态
异构系统
异构计算
异构集群
异步交互
异步处理
异步工具交互
异步流式传输
异步编程
异步计算
异步训练
异途同归映射
引导向量
引导式探索
引用分析
张量分解
张量并行
张量网络
张量计算
张量预测
弱信号检测
弱到强泛化
弱监督学习
强化学习
- StepReflect:面向移动端GUI智能体的结构化UI转换反思
- AgentOPSD:面向智能体强化学习的递归自蒸馏方法
- EnvACE:通过世界彩排将环境动力学内化用于智能体强化学习
- 新兴的零售投资组合管理应用:基于自然语言目标的个性化、税收意识强化学习
- LC-GRPO:通过朗之万修正弥合基于流的 GRPO 训练与推理差距
- CodeGrep:面向大模型编程智能体的强化学习检索代理
- ProDVI:用于价值网络初始化的程序化动力学先验
- AV-AIVAT:基于不完全信息博弈中认证随时有效停止机制,将智能体评估成本降低 74 倍
- 截图还是工具?混合 GUI-MCP 计算机操作智能体中的工具调用与多模态上下文管理
- CUDA-L2:通过强化学习超越 cuBLAS 的矩阵乘法性能
- 全象限有界裁剪 GRPO:消除无界盲区以实现稳定且泛化的训练
- MARS:用于奖励建模的边界与语义感知数据增强
- 四足机器人运动的快速具身自适应
- Dream-MPC:基于潜在想象的梯度模型预测控制
- LeRobot v0.6.0:想象、评估、改进
- 使用 Hugging Face Bucket 传输万亿参数:TRL 中的 Delta 权重同步机制
- vLLM V0 到 V1 迁移:在强化学习中纠正偏差前,先确保后端正确性
- Granite 4.1 大语言模型:构建解析
- Gated-BEPO:面向大语言模型智能体的置信门控贝尔曼信用分配
- DiDPO:面向编程智能体训练的差分双重策略优化
- Fisher-R1:训练用于可靠假设检验的大模型智能体
- SoRoMoX:快速、可微分且可并行化的软体机器人模型
- 基于决策树剪枝的可解释强化学习
- 加速器调试算法的自主发现
- OpenForgeRL:在任意环境中训练 Harness 原生智能体
- 面向长周期终端任务的递归合成
- 面向搜索智能体的上下文信息策略优化 (CIPO)
- 从专家演示中进行奖励分配的最小化要素
- 以少胜多:一种用于四足机器人运动的 Dyna 风格强化学习方法
- 强化学习中状态抽象的组合行为语义
- 反事实沙apley信用分配
- AndroidReality:移动智能体距离现实世界还有多远?
- FailForge:从持续失败中为代码智能体提炼程序性能力
- 提升多模态 RLVR 的泛化鲁棒性
- 阅读不等于推理:弥合视觉-文本压缩中的智能体策略鸿沟
- 面向主观任务的大语言模型推理:失效模式、缓解方案与动态推理路由
- 不匹配至关重要:超越Token一致性的在线蒸馏技术
- SkillReason:针对隐式用户请求的推理增强型智能体技能检索
- 听觉、视觉与追踪:全模态语言模型的时空视听声学事件推理
- DSLE:黑暗之魂首领战学习环境
- RL原生蒸馏:利用评分轨迹实现少步图像生成
- 多LLM智能体系统的动态治理与协作对话成果
- 迈向在线教育的可持续学习:一种强化学习方法
- 用强化学习削减AI数据中心能耗:从单GPU到整个集群的LLM训练实测功耗控制
- 从数字到判断:面向欧洲上市房地产的专业大语言模型智能体与强化学习
- CLAIM:基于不确定性度量的大语言模型开放域主动澄清框架
- CoAdapt-GUI:针对未见GUI应用的联合工作流上下文与策略自适应
- 让它煮吧:在序列决策中学习等待
- 强化大语言模型中步骤级推理以实现高效自我纠错
- GCPO:诊断与约束大模型 Rollout 强化学习中的子空间几何
- 评分标准随机丢弃(Rubric Dropout):缓解以评分标准为奖励的强化学习中奖励攻击的简单方法
- 学会说服暴露了大模型轻易放弃正确信念的弱点
- A-3PO:利用感知陈旧性的近端策略近似加速异步大模型训练
- 教会智能体AI学习罕见病诊断的专家推理能力
- TMRL:扩散时间步调制预训练助力高效策略微调
- DORA Explorer:在无需训练的情况下提升大语言模型的探索能力
- SBCO:面向规划智能体的自监督、验证器基础测试框架优化
- CHORUS:高覆盖率测试平台激励生成的互补专家模型
- 利用结合语义站点嵌入的强化学习缓解公交车串车现象
- 威胁引导的策略感知场景扰动:基于在线强化学习的安全自动驾驶
- 评估条件训练:教导模型泛化至更强的监督机制
- MBA:面向现实世界商业构思的多模态基准与智能体
- MindMemOS:面向AI智能体的可移植自进化内存操作系统层
- 教授幅度而非方向:面向多轮多步LLM智能体的验证器有界信用分配
- LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准与对齐
- 超越结果奖励:面向深度搜索智能体的步级自蒸馏策略优化
- 目标函数才是瓶颈:潜在世界模型编码了其规划器无法使用的信息
- 刻意练习:在预算限制下学习机器人技能
- AHD Agent:用于自动启发式设计的智能体强化学习
- 是的,Q-learning确实能助力离线上下文强化学习
- 训练强化学习模型玩转 Bonk.io
- 面向信号时序逻辑的奖励机
- 基于图结构的强化学习框架:用于自主LLM智能体的结构化漂移诊断与恢复
- 提升多模态 RLVR 的泛化鲁棒性
- 何时通信:多智能体强化学习中有原则的门控机制的信念分布与KL散度
- MINT:用于平衡多目标对齐的最小选择偏好蒸馏
- SkillCommit:通过行为验证的范围扩展实现智能体技能演进
- CoupVisor:基于回合与质疑决策支持的策略优化
- BaT:基于阶段评分准则的自进化医学研究智能体
- Chronocooked:强化学习智能体隐式区间计时基准测试
- Max-Q 选择性模仿:用于人机协同在线机器人学习
- CAPO:大语言模型智能体的约束感知提示词优化
- PertMind:通过细胞扰动数据强化学习激发大模型的涌现生物推理能力
- SignalReasoner:评估3B模型在信号数学推理中的性能上限
- PlanPO:面向多轮智能体大语言模型的群组规划感知策略优化
- Wuying-Browser-Agent:面向真实世界的长周期基础浏览器智能体
- LEGO-RL:面向代码智能体的原生基架强化学习
- 结合世界模型的Q学习 (Q-Learning With World Models)
- 无需高斯假设:面向 JEPA 世界模型的对比逆动力学
- 通过大模型引导的强化学习实现高效个性化AI导师
- ScreenSearch:具备不确定性感知能力的操作系统探索系统
- 扩散模型赋能更聪明的无人机:决策与建模
- Search-G1:基于表征内在奖励的扎根搜索智能体
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- SkillGate:长程智能体中策略内技能选择的训练方法
- MLREF:利用大语言模型实现强化学习奖励设计的模块化高效重用
- ADEPT:通过强化学习的预训练与后训练加速机器人灵巧操作
- VibeWorlding:多模态智能体能否端到端构建3D开放世界?
- G-ReAct:通过结构-状态协同演化实现图引导的深度搜索
- Why2Speak:拒绝行动策略的忠实推理
- 动态上下文调度:超越静态宇宙的学习
- 不要解决,只需比较:用于LLM智能体运行时干预的微型顾问
- AgentMercury:让你的智能体在大规模业务场景中自主合成可验证环境
- CIVA:针对视觉世界模型智能体的评论者诱导价值子空间攻击
- 学会何时思考:用于测试时计算分配的自适应推理
- 基于偏好的自蒸馏:通过奖励正则化超越 KL 匹配
- INFUSER:影响引导的自我进化提升大模型推理能力
- 提示、评委与教师:视觉语言数学推理中稀疏奖励强化学习的先验注入
- 让信用跟随计算:面向大语言模型强化学习的架构感知信用传递
- 自动驾驶课程学习的规模化扩展
- 人工共情:迈向无监督智能体检测与策略重构的框架
- SRPO:面向长视野推理的自反思策略优化
- 纠正学到的物理不变量可改善世界模型的前瞻推演
- 权重中被遗忘,工具中被找回:大模型智能体的工具去学习
- 基于良性事实的强化学习会放大对已记忆隐私数据的泄露
- HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化
- EDGE:智能体强化学习中引导式探索的经验蒸馏框架
- 面向高弹性空间机器人的无奖励持续自适应
- 如何稳定且高效地训练评判模型(Critic)
- 基于记忆增强的神经求解器用于路径优化问题
- 自进化科学智能体发现可泛化的具物理推理能力流体控制策略
- CMI-Mem:通过CMI增强强化学习实现具备泛化能力的长期记忆管理
- MetaRAG:面向智能体RAG的信念-动作对齐策略优化
- 算法影响揭示对齐中隐藏的社会选择结构
- 强化学习引导的演化策略优化用于偏好可调的异构敏捷对地观测卫星调度
- 大语言模型智能体的工具创建与使用联合优化
- Parason:揭示大语言模型推理中的子任务与试验并行性
- CAFE:自我提升的搜索智能体需要共同进化的反馈
- 大模型引导的工业过程操作决策上下文动作评估
- FARCA:面向具有事实监督的强化学习的事实对齐可靠性感知信用分配
- 对比分支策略优化 (CBPO)
- 基于可验证奖励的同策略蒸馏 (OPDVR)
- 基于强化学习的欧拉式车头时距控制缓解高速公路拥堵
- 通过算法与超参数的SHAP分析增强机器人强化学习的泛化能力
- Tournament-GRPO:面向开放式长文本生成强化学习的组内锦标赛奖励机制
- SaliMory:为对话智能体构建认知记忆系统
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量级无人机导航潜能
- 无真实标签的信用分配:基于执行重放对大模型智能体步级信用分配进行审计
- 最佳实践评判器优化 (BPCO)
- 位置与内容:解构大模型结构化输出中的结构与内容错误
- ASIL:用结构化状态与语义动作取代截图点击式交互
- 解耦可指令智能体的规划与控制
- SpeechGym:用于通过强化学习训练语音智能体的音频原生训练环境
- Behavior2Trip:基于用户行为轨迹迈向个性化旅行规划
- 并行与分布式推理语言模型的性能基础
- DeepPlanner:通过优势塑造扩展深度研究智能体的规划能力
- FlavourBench:用于大语言模型评估与后训练的可执行烹饪奖励地图
- 基于错误代码驱动的测试用例合成与密集奖励塑造的稳健代码强化学习
- 残差奖励模型:利用先验知识实现机器人领域高效基于偏好的强化学习
- 联邦几乎零成本,推理则不然:蛋白质表征工作流中AI联合科学家的权衡
- WM-R1:通过强化学习训练具备推理与世界模型利用能力的GUI智能体
- 带可验证奖励的程序学习:大模型后训练的符号反向传播
- 学习使用工具:用于工具集成数学推理的强化学习
- 先实现可玩,再追求优秀:面向小型对话游戏智能体的分阶段交互学习方法
- ContextLeak:通过恶意工具窃取大模型智能体上下文
- 超越搜索模仿:免搜索国际象棋的先验导向探索
- VICT:面向长视距大模型智能体强化学习的验证器注入信用追溯
- 语言模型评分细则引导强化学习综述
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 一种策略,适应任意预算:通过强化学习内化预算感知搜索
- 强化学习增强的大语言模型智能体求解复杂车辆路径问题
- WHALE:联合优化框架与模型权重的简单方法
- WiSDoM:面向多任务移动网络优化的基于混合专家模型的无线稀疏决策Transformer
- REFACTOR-VLA:类型化运动程序的无监督库学习
- 基于大语言模型程序合成的组合式机械设计
- 人工实验者:利用自主目标强化学习发现与控制自组织现象
- 学会记忆:面向长文本推理的记忆智能体端到端训练
- 智能体强化学习中的技能复用与压缩
- 使用 TRL 与 OpenEnv 训练会用代码画水彩画的代码模型
- 在线蒸馏相遇离线GRPO:训练紧凑型指令遵循重排器
- 后训练语言模型在编程竞赛中实现金牌表现
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- 面向海上监控中异构传感器选择的强化学习
- 用于加速工具使用型智能体的推测性宏指令提交(Speculative Macro Commit)
- PPO-STGNN:结合时空图神经网络与近端策略优化的云边端计算DAG任务调度方法
- 规划即推理的双平坦几何
- GRPO中隐藏的虚假优势
- DRACO:基于动态评分标准的长期智能体训练细粒度信用分配
- Terminal-Universe:将智能体轨迹转化为可扩展的终端环境
- StrixAE:面向真实场景复杂失真耦合的音频增强智能体
- 蒸馏前先验证:面向在线蒸馏的提示级教师门控机制
- 子空间推断助力基于偏好的高效主动奖励学习
- 当模型改动过多:论最小代码编辑的保真度
- 顺序优于联合:探索策略内蒸馏与RLVR之间的相互作用
- CoMAP:用于大语言模型智能体的世界模型与智能体策略共同演化框架
- SENTINEL-RL:将拓扑推理从安全运营中心(SOC)的LLM智能体中剥离
- 学会选择而非重新学习:基于硬路由推理 LoRA 混合模型
- LDC:通过动态控制生成研究构想的学习框架
- 迈向经济实惠的能源:用于电力公司需求响应项目的 Gymnasium 环境
- F-GRPO:别让你的策略只学显而易见的常识,而遗忘那些稀缺的解
- 多套具现强化学习学到了什么?编码智能体中的归因与可迁移性
- 极度稀疏的监督信号即可激发大模型的推理能力
- SQL-Zero:自我进化的 Text-to-SQL
- CHAMP:在线多人游戏中用于配对与预测的跨域混合架构
- AutoLR:实现工业级推荐系统中从研究到上线评审的自动化
- 面向成本感知导航的紧凑型贝尔曼扎根认知地图
- 通过贝叶斯视角统一 ICL、SFT 与 KL 正则化强化学习
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- 并非所有大语言模型的推理过程都可见于思维链中
- AutoFyn 技术报告:面向长视角智能体的非参数专家迭代法
- ARC-Bench:闭环重规划掩盖了冻结 JEPA 世界模型中失效的动作排序
- 学习用于部分可观测性下具身推理的反事实世界模型
- 《符文与魔法传说》中结合策略与价值网络的非完备搜索研究
- 利用强化学习激发多模态推理代理的自我验证能力
- 自对弈中近似价值迭代的惊人有效性
- SRPO:多智能体大语言模型的集合相对策略优化
- 量子AI会梦见路径吗?基于Grover干涉的路径积分慢思考
- 基于值函数的强化学习中批归一化前向模式的研究
- 基于最优输运贝尔曼平滑的二阶平滑规划
- 通过迭代 DPO 从奖励作弊中诱发突发性不对齐
- MOSAIC:用于跨范式智能体混合与人机协作的通用智能体级接口
- 爬坡 SWE 智能体:1700 个编程任务教会了 Kimi K2.7 什么
- T1:面向长程终端任务的强化学习智能体
- 在模型动摇处分叉:面向树状结构强化学习的信念转移分支策略
- 斩获 IMO 金牌的开源秘籍:面向奥林匹克数学的 Nemotron 训练实践
- AsyncFlow:面向高效大模型后训练的异步流式强化学习框架
- 基于 LoRA 与 HF Jobs 的异步 GRPO 训练:对象存储、代理与零 NCCL 实践
强化学习与SFT
归一化Transformer
归一化层
归因偏差
归因分析
归因方法
归纳偏置
归纳内容分析
归纳式学习
归纳推理
形式化推理
形式化数学
形式化方法
形式化模型
形式化证明
形式化语义
形式化逻辑
形式化验证
- SCP-NL2TL:结合语义验证与选择性保形预测的自然语言转时序逻辑规范框架
- 异构注意力内存的运行时可观测性
- 马尔可夫决策过程的属性驱动因果抽象
- WitCert:KV缓存量化的可靠运行时风险可观测性与控制门控
- 如你所愿:在精准农业中结合大语言模型与形式化验证的任务规划
- P^3:用于验证代码生成的联合程序与证明规划
- 自进化网络验证器
- PROVE-RT:使用大语言模型为实时系统生成机械化定理证明脚本
- Moose:\(mathcal{EL}^{++}\) 中具备推理捷径感知能力的潜在概念学习
- Vero:AI智能体能够构建形式化验证的软件代码库吗?
- 迈向安全的LLM智能体:规范、验证与执行综述
- 运行时压缩风险定价:压缩服务状态的随时有效准入与服务输出定律
- 基于推理的编译至可微分电路:实现基于OWL 2 DL的神经符号学习
- 图手术与 do-算子:无环结构因果模型的精确对应关系
- FVSpec:将现实世界的基于属性的测试转化为 Lean 挑战
- RDFdL:将 RDF 与微分动态逻辑相结合
- 基于形式化探索与神经符号细化的覆盖率驱动 RTL 断言生成
- 单一网关远未足够:为智能体AI组合有状态的前置动作控制
- 罗马诺夫三元组逻辑的形式化验证:用于滑动窗口3-CNF的验证过滤器及其在结构化公式中的应用
- 具备权威性的AI:从应用层到硅片
- 智能体何时应当停止?面向工具使用型大语言模型的证据携带式终止机制
- 从信息流视角看可解释性需求:规范与验证
- 罗马诺夫三元组逻辑的形式化验证:用于滑动窗口3-CNF的经验证过滤器及其在结构化公式中的应用
- FLARE:利用基于大语言模型的定理证明验证混合整数线性规划重构
- 当规范补全出错时:大语言模型中“跳跃”的形式化与度量
- 安全性无法组合:自主LLM智能体的非衰减循环状态
- FLARE:利用基于大语言模型的定理证明验证 MILP 重构
- PanelShield:面向机器人工业面板操作的可验证闭环安全规划
- SOVER:通过大模型辅助的SMT验证实现优化问题重构的形式化认证
- 超越编译:评估忠实的自然语言到 Lean 定理形式化
- 形式化验证费马大定理:Claude历时11天实现数学史里程碑
- CONTINUITY:面向可组合大模型智能体控制的安全上下文契约
- FVSpec:将现实世界基于属性的测试转化为 Lean 挑战
- Scratchy:基于视觉草稿板的多模态推理在EasyCrypt密码学证明生成中的应用
- Magenta:闭环数学推理与 Lean 形式化验证
- 这不是一只烟斗:将 AI 系统视为语义抽象的形式化框架
- 面向二进制对称信道的最优 (n,4) 二进制码 Dong-Yang 分类定理的机器验证证明
- 引入非基项子句学习拓展 SMT 求解能力
- FormalFlow:面向 MIP* = RE 核心定理的长程自动化形式化证明
形式语言学
影像设备维护
影响力评分
影子价格
循环Transformer
循环图
循环抑制
循环机制
循环架构
循环流
循环状态
循环神经网络
- 面向忆阻器的哈amard水库计算:规模化、结构化且无乘法器的递归结构
- 潜在循环思考:基于冻结大语言模型的连续隐空间循环精炼推理
- Transformer的拓扑困境
- 当量化破坏记忆:低精度时间序列推理中的循环状态回写机制
循环精炼
循环记忆
循证研究
微分几何
微分方程
微控制器
微服务
微模拟
微调
- 超越LoRA:你能打败最流行的微调技术吗?
- 使用 Sentence Transformers 训练和微调多模态嵌入与重排模型
- 从零构建一个AI文本检测器:涵盖数据集构建、模型训练、本地部署与RLVR
- 微调 Qwen3-27B 实现 C 到 Rust 代码转换:包含预训练、调试感知 SFT 与特定任务 SFT 的三阶段课程
- 语言模型微调中的幽灵相变:密度矩阵分析
- 大型语言模型在疟疾药物发现中的严谨评估:性能、规模与资源效用的权衡
微调脆弱性
微软Excel
心律失常
心智理论
心理健康
心理健康聊天机器人
心理咨询智能体
心理学基准
心理学建模
心理学效应
心理学框架
心理学说服
心理测量学
心理测验
心理计量学
心电图
心脏介入
心脏电生理
心脏磁共振
心血管AI
心血管医学
忆阻器
态势感知
思维树
思维漏斗
思维链
- 反事实模拟训练:提升思维链的忠实度
- MathShikkha:针对孟加拉语数学推理的小型语言模型中“仅答案”与“思维链”监督的对照研究
- 思维链何时有效、何时失效:大模型推理中串行深度瓶颈的实证研究
- XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链
- 基于自适应注意力匹配的推理过程思维感知 KV 缓存压缩
- UMER:通过面向对感知的判别推理统一通用多模态检索的嵌入与排序
- SAEM:用于思维链推理中内存高效 MoE 推理的阶段感知专家管理
- 正确的诊断,装饰性的推理:医疗思维链的扰动审计
- 并非所有评测觉察都千篇一律:能力框架可预测合规性
- 句法与语义:Transformer如何学习深层依赖
- 潜在循环思考:基于冻结大语言模型的连续隐空间循环精炼推理
- 照我说的做,别学我做的:大语言模型中的指令-归纳冲突
- 多层状态空间模型(SSM)的表达能力与局限性
</think>无法停止推理:虚假思维链终止现象分析- 并非所有大语言模型的推理过程都可见于思维链中
- 视觉语言模型中思维链忠实度的反事实测试评估
思维链推理
思考过程
性别偏见
性能优化
- 分析 Linux 上 Go 1.27 程序的内存映射
- CUDA-L2:通过强化学习超越 cuBLAS 的矩阵乘法性能
- 将 Nunchaku 4-bit 扩散推理引入 Diffusers
- 将 hf CLI 设计为面向智能体的 Hub 交互优化工具
- 在 Transformers.js 中体验提议中的跨域存储 API
- PyTorch 性能分析(第二部分):从 nn.Linear 到融合 MLP
- PyTorch 性能剖析(第一篇):
torch.profiler新手入门指南 - LLMVisor:面向多租户大模型推理的实时延迟归因模型
- LGNNIC:利用智能网卡(SmartNIC)加速大规模图神经网络(GNN)训练
- 我们能否优化性能与碳排放的盈亏平衡点?探索更绿色的大语言模型
- 无攻击者的游戏:选择压力下大模型驱动搜索中的基准测试指纹识别
- 何时选择只读副本(Read Replicas)与更大计算资源(Bigger Compute)
- Supabase Storage:性能、安全性与可靠性的重大更新
- pgvector v0.7.0 的新特性解析
- PostgreSQL 表膨胀最小化指南
- Systemd 启动缓慢之谜:一次排查经历
- KVBoost:基于偏差引导重计算的块级键值缓存重用技术,助力高效大模型推理
- SuperLocalMemory 4.0:面向AI智能体的受管控内存操作系统
- 并行与分布式推理语言模型的性能基础
- 介绍 @huggingface/kernels:面向本地 AI 的 200 多个 WebGPU 核函数
- CacheBridge:高效的跨模型 KV 缓存传输
- Nova:面向深度学习的端到端 MLIR 编译器
- 静态分配与恒定工作量:构建高可靠系统的架构模式
- MaxKernel:面向 TPU 的智能体内核生成
- 耗时一年:WebAssembly 终于登陆 Anubis
- 2026 年各类 Unix 系统的平均负载机制深度剖析
性能分析
性能剖析
性能压测
性能建模
性能评估
性能评测
性能调优
性能退化
性能预测
恶意软件检测
情境感知
情境错觉
情感分析
情感理解
情感生成
情感计算
- 切合个人实际:通用 SSL 表征在真实生活 PPG 情绪检测中的局限性
- 重要他人 AI:作为长期关系智能的身份、记忆与情绪调节
- 推断人工代理的情感意识:一个案例研究
- 你无法偏好未曾采样的情感:DPO微调大语言模型中的强度不足现象
情感识别
情绪计算
惯性偏差
惯性偏见
意图控制
意图检测
意图蒸馏
意第绪语
感知与规划
感知纠正蒸馏
成分数据分析
成本优化
- 脚手架的重要性胜过接口:对七种智能体脚手架、五种语言模型以及一项软件任务中 MCP 与 CLI 工具调用的对照比较
- 并非所有 Token 都是平等的:面向智能体 LLM 系统的感知通胀路由
- StateM:通过大模型外壳扩放(Harness Scaling),在 Terminal-Bench 2.1 上达成 95.3% 的原始准确率与 15 美元的极致前沿运行成本
- DumpsterCluster:从“垃圾堆”到运行 LLaMA-70B 的 60 美元 GPU 集群
- 评分需要的是评分标准,而非大模型的智能
- 解码 AI:智能体循环架构与供应商经济学
- 交接税:LLM 智能体中延续非原生轨迹的代价
- 你的AI Agent能更省钱吗?探究任务规范对智能体编程任务中Token消耗的影响
- 你的AI Agent能更省钱吗?探究任务规范对智能体编码任务中Token消耗的影响
- 面向语音大模型服务的可扩展上下文编排
成本控制
成本效率
战略决策
房地产
手写识别
手术室工作流
手术机器人
手术视频理解
手语合成
手语翻译
手语识别
扎兰基维奇问题
打印机
托卡马克
执行上下文
执行审计
执行模型
扩展假设
扩展定律
扩展开发
扩展法则
扩展现实
扩散变压器
扩散大语言模型
扩散模型
- LC-GRPO:通过朗之万修正弥合基于流的 GRPO 训练与推理差距
- UniVVT:用于高保真视频虚拟试穿的统一端到端框架
- 域门控潜在扩散:基于第一性原理验证的 HMX 级含能材料生成式逆向设计
- Fluid-DiT:用于流体流动模拟学习的无图扩散Transformer
- WAM-Diff2:用于高效率自动驾驶VLA的分层自回归到扩散蒸馏
- AI 预测集合是否采样了正确的条件分布?
- 当隐空间遗忘像素:恢复扩散Transformer超分辨率中的保真度
- RL原生蒸馏:利用评分轨迹实现少步图像生成
- 忠实、充分且可解释:通过离散扩散反演重新审视图反事实解释
- TMRL:扩散时间步调制预训练助力高效策略微调
- 连续交互扩散:面向异步工具增强推理的扩散原生运行时
- 多模态认知的层次化基于能量的模型
- DiffImaginE:利用扩散模型“想象”来验证实体类型
- RadarGen:基于摄像头的车载雷达点云生成技术
- CForce:通过一致性强迫提升扩散大语言模型的并行解码能力
- 无需求解器的可解推箱子(Sokoban)生成:基于扩散模型的方法
- MLLM引导的文本转视频生成语义纠错
- 扩散模型赋能更聪明的无人机:决策与建模
- 学习状态感知的面向小规模数据集动态生成式数据增强
- 衡量依赖鸿沟:诊断表格生成模型中的列间保真度
- DF3DV-1K:无干扰新视角合成的大规模数据集与基准
- 服务掩码扩散大语言模型:来自真实硬件的特征分析与设计原则
- 面向条件式CMR合成的生成式基础模型元数据感知适应
- 从语料库到协同进化能力:面向通用图像生成的以能力为中心的数据设计
- CoGeo-GS:3D场景中基于概念驱动与几何感知的多物体擦除
- Egosurg:利用环境摄像机进行手术室工作流第一人称回放的任意视角合成
- CollaFuse:协作式扩散模型
- 扩散模型原理
- 物理引导的流匹配用于CT图像重建
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- GeoSPRINT:扩散轨迹推理中基于几何冗余感知的步数剪枝
- DiffIE:基于扩散模型的开放式信息抽取
- 音视频模型中的注意力三角形
- PrivateHub:用于私密传感器密集型环境数据生成的对比扩散模型
- ScoreMix:利用扩散模型中的分数组合生成合成数据以提升识别性能
- 基于潜空间探针的扩散式音乐生成音高类引导方法
- 联邦学习框架下X射线透视中导管与导丝分割的新方法
- VAE 与扩散模型的泛化能力:统一的信息论分析框架
- 基于循环流的思考:通过动态计算分配提升深度推理能力
- 连续扩散语言模型在规模化扩展上可媲美离散扩散
扩散策略
扩散语言模型
- CORA-Diff:面向高效扩散语言模型推理的置信度导向残差接受机制
- CAI-DLLM:扩散语言模型的收敛感知推理
- 超越Token位置:扩散语言模型中跨去噪步骤的安全对齐
- 扩散语言模型中的原位指令遵循
扫描探针显微镜
扰动分析
批归一化
批量烧录
技术侦察对抗
技术综述
技能习得
技能复用
技能库
技能库维护
技能检索
技能淘汰
技能演化
技能演进
技能蒸馏
技能迁移
技能进化
技能选择
投机解码
- 当草稿模型在进化:投机解码与在线学习的完美结合
- 使用 LFM2.5-DSpark 实现高达 3.2 倍的推理加速
- TreeWY:门控DeltaNet混合模型的投机验证
- 投机探测:以投机解码成本实现大模型监控
投毒抢注
投票机制
投资组合管理
投资逻辑
护栏机制
报告定位
报告生成
抽象解释
拆分学习
拉斯施测量理论
拉施测量理论
拉普拉斯方法
拉格朗日乘子
拉格朗日力学
拒绝机制
- 上游决策,滞后写入:定位与评估多语言 MoE 的跨语言拒绝电路
- 上游决策,滞后执行:定位并评估多语言混合专家模型(MoE)的跨语言拒绝回路
- 引君入瓮与恢复:通过投毒内部拒绝信号防御白盒编辑越狱
- 拒绝的几何学:为什么事后安全机制如此脆弱,而预训练阶段的安全机制能够持久
拒绝行为
拒绝采样微调
拓扑分析
拓扑感知
拓扑数据分析
拓扑深度学习
拜占庭鲁棒性
拟人化评估
拟阵约束
持久化
持久化内存
持久化威胁
持久化记忆
持续学习
- 使用 Strands Agents、LeRobot 和 Hugging Face 存储桶在单一平台完成录制、训练与部署
- ReForge:利用经过验证的大语言模型修改,让ABR算法持续演进永不过时
- 遗忘、可塑性与协同观测:持续学习的第三维度
- 锚定偏差:面向持续学习的多模态大语言模型持久性公平后门攻击
- 面向高弹性空间机器人的无奖励持续自适应
- 巩固世界的边缘:多智能体世界边界中的持续学习问题
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越正则化方法
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越者正则化
- 为什么微调会加剧幻觉以及如何解决
- 当合成数据带来负面效应:大模型智能体技能检索中的灾难性遗忘研究
持续改进
持续部署
持续预训练
指代表达式分割
指令微调
指令生成
指令遵循
- EnterpriseRAG:基准测试大模型在非理想企业检索条件下的指令遵循与鲁棒性
- 小型推理模型在函数调用中即为指令遵循者
- 照我说的做,别学我做的:大语言模型中的指令-归纳冲突
- DuplexSpeechBench-IFEval:评估全双工语音智能体中的隐式指令遵循能力
- 指令复制作为推理时控制基元
- 扩散语言模型中的原位指令遵循
- LLM 如何遵循指令:多项语言技能的熟练协调,而非通用机制
指数族
捷径学习
授权架构
授权管理
排列优化
排名反转
排序
排队论
探索与开发
探针分析
控制向量
控制权丧失
控制综合
控制耦合
推测解码
- MemSpec:面向边缘设备推测解码自适应草稿调度的内存感知运行时
- S2-MoE:在边缘设备上实现高效的混合专家模型自推测解码
- 用于加速工具使用型智能体的推测性宏指令提交(Speculative Macro Commit)
推演剪枝
推理
推理优化
- 重精炼胜过重采样:大语言模型推理的测试时自我修正
- InsightEmb:学习用于智能体洞察检索的动作-意图嵌入
- vLLM 原生速度 Transformers 模型后端
- CoBa:通过计算均衡路由实现高性价比的测试时扩展
- 面向搜索智能体的上下文信息策略优化 (CIPO)
- 广度推理而非深度推理:将推理溢价摊销为蒸馏技能
- 通过置信度动态实现大型推理模型的提前停止
- 当熵不再足够:在大模型输出长度预测中找回丢失的语义
- 从大模型推理到智能体工作负载:服务系统的特征分析与启示
- MLLM引导的文本转视频生成语义纠错
- 轻量级多模态模型能评估大语言模型的推理性能吗?面向计算最优文档推理的研究
- 大语言模型无训练推理时自我反思与成本受限早停机制
- 学会何时思考:用于测试时计算分配的自适应推理
- CacheSpec:在大语言模型中为小模型寻找最佳平衡点
- 当熵不再足够:在大语言模型输出长度预测中找回丢失的语义
- 选择性再生解码:面向推理时推理的轨迹级干预
- ReflCtrl:通过表征工程高效控制大语言模型反思
- 迷失于压缩:提取式提示词压缩器跨语言受控审计
- SABER:基于对抗分支探测的大语言模型推理稳定性感知早退机制
- 大型视觉语言模型中用于缓解幻觉的动态对齐补偿方法
- 语言模型能够自主控制注意力
- GrowPage:用于高效大模型推理服务的按需 KV 预算管理
</think>无法停止推理:虚假思维链终止现象分析- 审计多智能体大模型推理树:性能超越多数投票与LLM作为裁判
- 通过幻觉空间投影减少 Whisper 模型中的幻觉转录
- 在细粒度混合专家模型中免训练将激活专家减半
推理加速
- MAPLE:MoE 自适应即插即用层级专家分配框架
- CAI-DLLM:扩散语言模型的收敛感知推理
- 基于分层语言模型的动态多字节预测
- Parason:揭示大语言模型推理中的子任务与试验并行性
- SPD:生成式重排的单次前向传递解码方法
- HISA:面向细粒度稀疏注意力的高效分层索引机制
- 突破 1.58 比特极限:三值大语言模型的极致压缩与加速
推理图
推理失效
推理忠实度
推理扩展
推理捷径
推理控制
推理效率
推理时优化
推理时干预
推理时控制
推理时操控
推理时调度
推理时防御
推理期概率聚合
推理校准
推理涌现
推理状态
推理瓶颈
推理系统
推理级联
推理结构
推理能力
- 啄木鸟蒸馏:弱模型诊断强模型中的推理缺陷
- REIN:通过反思与弃权对齐弥合推理与可靠性之间的鸿沟
- 当自一致性适得其反:多数表决损害小型大语言模型在多数硬科学问题上的表现
- INFUSER:影响引导的自我进化提升大模型推理能力
- 基于可验证奖励的同策略蒸馏 (OPDVR)
- 当规范补全出错时:大语言模型中“跳跃”的形式化与度量
- Think-at-Hard:用于提升推理能力的动态循环 Transformer
- 保持统计严谨性的重要性:对 GSM-Symbolic 的批判性重新评估
- 顺序优于联合:探索策略内蒸馏与RLVR之间的相互作用
- 极度稀疏的监督信号即可激发大模型的推理能力
推理行为
推理计算
推理设置
推理评估
推理语言模型
推理轨迹
推理过程
推理阶段
推理阶段搜索
推理预算
推箱子
推荐基准
推荐系统
- 塑造你的信息流:基于大语言模型的对话式推荐智能体系统
- 迈向双塔推荐模型的理论理解
- 表面公平?大语言模型推荐系统中隐藏输出公平性差距的基准测试
- 面向主观任务的大语言模型推理:失效模式、缓解方案与动态推理路由
- CoRCi:跨域序列推荐中相干兴趣的交叉重构建模
- 基于逆向心智理论的内容推荐建模:从网页浏览到动态智能界面
- RecSys Factory:将大模型智能体自主性限制在工业推荐系统生命周期的决策点上
- VLM2Rec:解决多模态序列推荐中视觉-语言模型嵌入器的模态崩溃问题
- FedCGR:联邦跨域生成式推荐
- 从预测到增量:大规模目标定位与推荐的因果优化
- 亲爱的算法:用于统一搜索与推荐的注重精度优先的智能体意图层
- 解构推荐系统中的内容陈旧度:用于替代与衰减的双滤镜框架
- ERASE:用于现代推荐系统加速训练的早期反向传播调度方案
- rEDMRec:将大语言模型推理蒸馏为可编辑的推荐经验记忆
- 大尺度推荐解释中“大模型即裁判”的生命周期管理
- 为什么是这个而不是那个?通过挖掘用户画像实现成对反事实解释
- 从梯度提升树到深度推荐器:生产环境客服推荐系统迁移的实战经验
- 面向超大规模电商的时效感知复购预测:多界面生鲜推荐的生存分析模型
- 面向超大规模电商的时序感知复购预测:多场景生鲜推荐的生存分析模型
- 从特征交互到特征传输:可扩展推荐模型的统一构建模块
- AutoLR:实现工业级推荐系统中从研究到上线评审的自动化
- 超越同购关系:Allegro互补推荐系统的演进
- DeepAffinity:利用小型语言模型预测电子商务中的长期商品属性偏好
描述逻辑
提前停止
提示工程
提示微调
提示词优化
- CAPO:大语言模型智能体的约束感知提示词优化
- 加权记忆树:为长程 LLM 智能体保留关键信息
- DynaContext:异构参数提取中优化提示词的自改进动态上下文构建方法
- 朴素提示词优化:重新审视复杂提示词搜索的必要性
- 朴素提示词优化:重新审视对复杂提示词搜索的需求
- 大模型作为裁判并非全知全能:为什么自我进化智能体需要确定性防护栏
- 超越提示词:大语言模型工具智能体外挂框架的度量与优化
提示词分析
提示词压缩
提示词安全
提示词工程
- 当大模型智能体进行博弈:供应链中的私有信息与动态讨价还价
- 你的提示词并非唯一的提示词:大模型对结构化输出模式描述的权重究竟有多高?
- MCP 中的大语言模型至关重要:衡量由大语言模型驱动的低效资源利用
- 沉睡的智能体:基于要点的上下文压缩丢失了什么及其原因
- 图结构评分标准:将评分标准编译为用于大模型裁判的类型化评估图
- 影响力策略重要吗?大语言模型代码生成中提示词框架效应的研究
- LinkedIn的自进化智能客服系统
- CLAUDE.md 为什么会不断膨胀?智能体编程中的“灾难性记忆”现象
- MazzikaAI:用于实时阿拉伯木卡姆即兴伴奏的基于知识的演奏到提示词编译器
- 罕见异常失效下的解释性参与:模型行为的渐进稀疏性(或:渐进式AI)
- 揭秘智能体技能(Agent Skills):它们为何奏效——以及何时会失效
- 工具返回结果比纯文本更具权威性吗?基于 Claude Opus 5 针对合成赋值任务中虚假声明采纳的三项前瞻性研究
- 提示词的价值:一种大模型相对柯尔莫哥洛夫复杂度的方法
- 针对一个模型封闭,对另一个模型开放:法律多项选择基准测试中的“纯选项可解性”
- 多智能体AI工作流中的Token优化与上下文窗口管理
- 评分需要的是评分标准,而非大模型的智能
- 大语言模型无训练推理时自我反思与成本受限早停机制
- 什么是推理?
- 我的 agent.md:如何利用它提升大模型辅助编程的代码质量
- 高效评分:面向低成本大模型作文评分的强盗算法驱动提示词选择框架
- mimeo:将公开专家文集编译为智能体技能并测试知识迁移
- 精修却未决:识别长程工具使用智能体中的后期压力状态
- WHALE:联合优化框架与模型权重的简单方法
- 药物毒性预测中提示词工程的分析研究
- 通过人机交互实现高效测试时适应
- 继承式智能体记忆预算验证中的计划指针与记录指令形式
- 问两次,看两次:提示词回显解决了视觉语言模型中的“问题前置悖论”
- 无需拒绝的拒绝:安全微调响应的结构化分析与大语言模型误拒率的降低
- 重形式轻实质:内容不变的外壳如何颠覆大模型安全评判器的裁决
- steering 干扰反映了模型的默认倾向,而非行为方向本身
- 超越提示词工程:基于对数几率空间融合的语音大模型高效鲁棒上下文偏置 (LOGIC)
提示词微调
提示词攻击
提示词敏感性
提示词注入
- 用一张纸劫持机器人:VLM控制机器人中物理提示词注入的系统性研究
- 并非真正的无障碍:Android辅助功能如何将移动端AI智能体暴露于间接提示词注入风险中
- 提示词注入的解构:一种用于结构化分析的组件模型
- 抵御知识投毒与提示词注入的检索增强型入侵检测防御机制
- 安全使用 Supabase MCP 与大语言模型:防范提示词注入与深度防御指南
- BrowseSafe:理解并预防 AI 浏览器智能体中的提示词注入
- 有界智能体:多智能体AI系统的委派安全性
- 效用遭受攻击:智能体记忆投毒与内容筛选及溯源排名的局限性
- InjecMEM:针对大模型智能体记忆系统的内存注入攻击
- 语义叠加:超越Token与控制向量的提示词注入防御技术
- 潜诊断分类法:构建分类器及诊断其决策的框架及其在提示词注入检测中的应用
- 语义叠加层:超越词元与引导向量的提示词注入防御新范式
- 自主性税:防御训练破坏了 LLM 智能体
- 针对基于Mamba语言模型的隐藏状态投毒攻击
- 将间接提示词注入重新构想为测试时搜索问题
- 语义叠加:利用超越Token和引导向量的注解技术缓解提示词注入
- AgentDrift:带有步骤标签的提示词注入劫持大模型智能体轨迹基准
提示词越狱
插件市场
插件开发
搜索与推荐
搜索增强语言模型
搜索智能体
搜索策略
搜索重排
操作模型
操作系统
- Zig 的 Io.Threaded 设计精妙
- MindMemOS:面向AI智能体的可移植自进化内存操作系统层
- Agent libOS:面向受能力控制的自进化大模型智能体的运行时底层架构
- String:一个让每个应用皆为 Markdown 文件的智能体操作系统
- CrabOS:人机共栖操作系统
- 在 NTP 诞生之前:Daytime 与 Time 协议的前世今生
- 面向高扇出智能体沙箱的内存压缩技术
- 2026 年各类 Unix 系统的平均负载机制深度剖析
操作系统探索
支付协议
收敛速度
攻击图
攻击复现
放射学
故障安全
故障定位
故障归因
故障检测
故障注入
故障诊断
效价唤醒度
效率优化
- OlmoEarth v1.1:一个更高效的地球观测模型家族
- 让它煮吧:在序列决策中学习等待
- 前向传递域自适应(无需跨层反向传播)
- 粗粒度索引,细粒度证据:长视频RAG中时间粒度的解耦
- ACE:基于MoE的大语言模型自适应免校准专家跳过技术
效率提升
效用理论
敏感实体别名生成器
敏捷对地观测卫星
教学序列
教育AI
教育决策支持
教育工具
教育技术
教育测评
教育科技
教育评估
散度指标
数值分析
- 锚定正则化直接最小二乘法(ARDLS):整合既有优先级算子以实现层次分析法中的权重提取
- 物理信息随机配置机:一种用于非线性微分方程的无反向传播快速训练神经网络
- 神经算子的保角不确定性量化保证
- 多维空间中随机特征方法的谱收敛性
数值天气预报
数值接地框架
数值推理
数值计算
数字人文
数字孪生
- 扩散模型赋能更聪明的无人机:决策与建模
- 用于家禽养殖福利约束控制的混合边缘云数字孪生系统
- 运行级数字孪生诊所:实现具身智能基于任务的评估
- DNative-Twin:用于可重建智能体决策的决策图与数字孪生
数字幻觉
数字格式
数字病理学
数字能力
数学
- cos(200!) 的计算奥秘:为什么大数的三角函数需要高精度算术
- 阿Hadamard矩阵的构造
- 阿hadamard矩阵的压缩存储
- 逼近游戏:有理数与无理数
- 修正贝塞尔函数到底“修正”在哪里?
- 阶乘到底有多大?
数学公式识别
数学原理
数学发现
数学定理证明
数学推理
- 啄木鸟蒸馏:弱模型诊断强模型中的推理缺陷
- Ask-E:用于校准问题生成的环境
- MathShikkha:针对孟加拉语数学推理的小型语言模型中“仅答案”与“思维链”监督的对照研究
- SignalReasoner:评估3B模型在信号数学推理中的性能上限
- 提示、评委与教师:视觉语言数学推理中稀疏奖励强化学习的先验注入
- 学习使用工具:用于工具集成数学推理的强化学习
- Magenta:闭环数学推理与 Lean 形式化验证
- 斩获 IMO 金牌的开源秘籍:面向奥林匹克数学的 Nemotron 训练实践
- Stellar Colosseum:面向数学与理论计算机科学长程研究的多智能体竞技框架
数学物理
数学研究
数学规划
数学证明
数据中心
数据中心能耗
数据仓库
数据分析
数据分解
数据协同观测
数据压实
数据压缩
数据可视化
数据合成
数据合规
数据同构化
数据增强
- MARS:用于奖励建模的边界与语义感知数据增强
- TailBooster:用于极限值增强与操作有效性强制约束的双层生成式框架
- 揭秘数据受限下语言模型预训练的训练时数据增强
- TRACE:基于多源证据溯源的代理式商品目录增强框架
- ScoreMix:利用扩散模型中的分数组合生成合成数据以提升识别性能
数据安全
数据对齐
数据工程
- SiriusDeliver:腾讯数仓交付自动化技术实践
- 先治而后连:生产级知识图谱中的身份与本体标记
- 无干净参考集的智能体数据清洗:能力与权衡的实验研究
- 文档计数不等于文本计数:Web-PDF 语料库统计中的单位偏差
- 从语料库到协同进化能力:面向通用图像生成的以能力为中心的数据设计
- 预训练进展主要来源于数据
数据库
- InferQ:面向量子电路模拟的数据库基准测试
- ScaleSense:阿里巴巴 AnalyticDB 中基于学习型资源评估的成本智能扩展框架
- 何时选择只读副本(Read Replicas)与更大计算资源(Bigger Compute)
- Supabase 推出支持 Iceberg 的分析存储桶(Analytics Buckets)
- Data API 路由至最近的只读副本
- database.build(前身 postgres.new):配备 AI 交互界面的浏览器端 Postgres 数据库
- FluctlightDB:面向 AI Agent 的数据内存模型
- Zeta-Lite:面向智能体记忆的并发、可分支浏览器内 SQL 数据库
- Reflect-SQL:基于自我反思的 Text-to-SQL 框架
数据库优化
数据库同步
数据库安全
数据库开发
数据库扩展
数据库系统
数据库维护
数据库设计
数据库调优
数据库连接
数据归约
数据手册
数据授权
数据映射
数据杂质
数据模型
数据治理
数据泄露
数据流架构
数据流编译
数据混合
数据清洗
数据湖
数据漂移
数据破解
数据科学
数据窃取
数据筛选
数据管理
数据编码
数据血缘
数据表解析
数据规模化
数据质量
数据选择
数据配比
数据采集
数据重复
数据隐私
数据集
- FI-TW:用于芬兰铁路晚点分析的开放列车天气数据集
- 基于多智能体取证推理的通用深度伪造视频检测
- SignVerse-2M:一个包含 55 种以上手语、拥有两百万剪辑的姿态原生宇宙
- DF3DV-1K:无干扰新视角合成的大规模数据集与基准
- 基于预训练特征、数据增强与全新 SheetSage-A2S 数据集的音频转乐谱系统
- SpecMine:大规模规范驱动开发(SDD)工件语料库
- TamilEOT:泰米尔语电话语音中语义轮次结束检测的数据集与模型
- AgentDrift:带有步骤标签的提示词注入劫持大模型智能体轨迹基准
数据集构建
数据集漏洞
数据驱动模型
数论
整数规划
- 基于边的连续型 p-中值问题及其在物流区划中的应用
- 使用 CPMpy 将有限域整数约束模型翻译为 CP/SMT/ILP/PB/SAT 求解器
- 从学生风险预测到SC2R:面向教育决策支持的语义约束反事实归因
- GAMMA:任意预算下混合精度模型的全局比特分配
- GAMMA:面向任意预算的混合精度模型全局位分配框架
- 使用约束生成整数规划的反事实路由
整曲训练
文件系统
文化偏见
文化对齐
文化推理
文化理解
文学化编程
文本分块
文本分析
文本分类
文本到图像检索
文本属性图
文本归因
文本检测
文本水印
文本溯源
文本生成
文本生成音乐
文本负债
文本转视频
文本转语音
文本重写
文档分块
文档分类
文档处理
文档智能
文档检索
文档理解
文档管理
文档结构理解
文档解析
文档问答
文献综述
文言文
断言生成
斯坦纳旅行商问题
斯特林近似
新生儿医学
新视角合成
新闻报童模型
新颖性验证
方法论幻觉
方法论评估
旅行规划
旋转不变性
旋转量化
无人机
无人机安全
无人机导航
无人机检测
无反向传播
无套利约束
无根容器
无梯度
无理数
无监督域适应
无监督学习
- 基于Volve油田的基础井况异常检测:构建标签、基线模型与双头模型
- 偏微分方程基础模型的无监督自适应
- 利用GRACE卫星数据无监督检测加纳地下水储量异常
- 形状算子主成分分析:面向几何机器学习_曲率感知投影
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- 人工共情:迈向无监督智能体检测与策略重构的框架
无监督推理
无监督特征选择
无盒分析
无线电波传播
无线网络优化
无线通信
- GSBF:面向环境感知波束赋形的 3D 高斯溅射技术
- 基于叠加DMRS与数据传输的最优功率分配及AI接收机设计
- CM-MAE:面向视觉-无线应用物理机理引导的跨模态自监督学习框架
- 面向CSI反馈的Learnware:场景专用小模型如何发挥巨大作用
- 面向无线场建模的物理展开神经算子
- GCNO:用于无线信道物理压缩的格拉姆切比雪夫神经算子
- AirLLM:基于扩散策略的自适应 LoRA,用于大语言模型的无线远程微调
无训练
无训练方法
早停机制
早退机制
时序图网络
时序多信号融合
时序控制
时序电路
时序知识图谱
时序逻辑
时空数据挖掘
时空注意力
时空追踪
时空预测
时间一致性
时间信号
时间序列
- 面向放牧生产系统的牛群生长模式与增重预测混合机器学习框架
- OTIS:使用微型编码器学习高质量时间序列特征
- TSQueryBench:用于时间序列解释的大模型裁判评测基准
- 面向多站点工业预测性维护的长程Transformer分位数故障预测
时间序列分析
时间序列分类
时间序列基础模型
时间序列预测
- TS-RAG:用于时间序列预测的检索增强生成
- QFCQT:用于高波动性时间序列预测的混沌门控量化变压器框架
- KReF:用于长期时间序列预测与预测不确定性的免训练检索框架
- 追求 SOTA:时间序列预测必须采用分类特定的评估方法以消除虚假增益
- TinyCast:基于计算周期的概率化零样本预测模型
- AsyTO:用于参数高效的多变量时间序列预测的不对称时间算子
- 从基函数的视角重新审视不规则时间序列预测
- MotoSafety:利用学习型时间重要性在时间压力下进行两轮车碰撞风险评估的边缘AI
时间感知
时间抽象
时间推理
时间规划
时频先验
昇腾NPU
星际语言学
显存优化
- 让知识蒸馏成本大幅降低以实现规模化运行
- 量化智能体剖析:代码合成智能体工作负载中的显存稳定性与预测
- UltraQuant:面向重度上下文智能体的 4-bit KV Cache 压缩技术
- 直接问工具,别瞎猜:智能体工具调用自带运行进度,推理系统理应主动读取
显微镜控制
普纳语
晶体管
智慧农业
智慧图谱
智能交通
- 利用结合语义站点嵌入的强化学习缓解公交车串车现象
- HLSR:面向实时拥堵规避的混合实时预测选择性动态车辆重路由
- MotoSafety:利用学习型时间重要性在时间压力下进行两轮车碰撞风险评估的边缘AI
- 智能边缘计算
智能交通系统
智能代理
智能体
- AgentOPSD:面向智能体强化学习的递归自蒸馏方法
- CodeGrep:面向大模型编程智能体的强化学习检索代理
- 超越 Top-K:用可解释的智能体操作替代黑盒检索
- PICopilot:基于大语言模型的智能体框架,助力光子集成电路脚本化设计
- A-SR:基于分层协同的自进化智能体大模型符号回归
- WebRider:面向实时网页辅助的个性化意图控制器
- 智能体记忆蒸馏:利用分层教师记忆赋能小型大语言模型智能体
- 塑造你的信息流:基于大语言模型的对话式推荐智能体系统
- AI角色会成长吗?重大生活事件后LLM智能体个性演变的分析与基准测试
- NiyamAI:一个基于零知识证明构建、具备密码学可验证护栏的意图绑定型AI智能体
- 基于智能体混合自顶向下与自底向上方法的知识图谱生成
- 迈向用于决策与智能体 AI 的因果数据管理生态系统
- 面向长周期终端任务的递归合成
- 广度推理而非深度推理:将推理溢价摊销为蒸馏技能
- PolicyKG:将机构政策转化为 SHACL 知识图谱的智能体 LLM 流水线
- 商业真相而非 SQL 准确性:基于规则门控的 7B 分析智能体表现优于直接提示的 32B 基线模型
- GALA:微服务根因分析与事件响应的图增强大模型智能体
- 从数字到判断:面向欧洲上市房地产的专业大语言模型智能体与强化学习
- 沉睡的智能体:基于要点的上下文压缩丢失了什么及其原因
- 超越单轮置信度:LLM 智能体的轨迹自适应不确定性量化
- Ready Cohorts:LLM 智能体控制中的 GPU 机会边界与主机往返优化
- 教授幅度而非方向:面向多轮多步LLM智能体的验证器有界信用分配
- SynAct:用于自适应综合优化的推理-行动大语言模型智能体
- 从非结构化召回转向模式接地内存:通过迭代式、模式感知的提取实现可靠的AI内存
- 揭秘智能体技能(Agent Skills):它们为何奏效——以及何时会失效
- 无干净参考集的智能体数据清洗:能力与权衡的实验研究
- SCOPE:面向视频世界模型的评分隔离智能优化框架
- 量化智能体剖析:代码合成智能体工作负载中的显存稳定性与预测
- 从大模型推理到智能体工作负载:服务系统的特征分析与启示
- CAPO:大语言模型智能体的约束感知提示词优化
- PlanPO:面向多轮智能体大语言模型的群组规划感知策略优化
- TRUSS:迈向任务可靠与用户安全的自动化智能体技能生成
- 面向关键任务基础设施运营的LLM智能体任务感知约束适配
- 基于确定性几何与受控智能体视觉语言优化的结构图纸转模型方法
- 盲目的策展人:有偏见的评判者如何悄无声息地阻碍自进化智能体的技能淘汰
- Palmyra x6 技术报告:基于锚定监督微调的智能体与工具调用模型
- Search-G1:基于表征内在奖励的扎根搜索智能体
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 你的边缘设备是以单次前向传递进行基准测试的,但你的Agent将运行循环
- 加权记忆树:为长程 LLM 智能体保留关键信息
- TRACE:基于多源证据溯源的代理式商品目录增强框架
- 不要解决,只需比较:用于LLM智能体运行时干预的微型顾问
- SchemaRouter:面向高效异构智能体 RAG 的字段感知工具路由
- 上下文即环境:面向长程智能体的程序化上下文管理
- LLM4LLM:通过闭环智能体优化弥合内核基准与真实部署的差距
- HERO:用于长程智能体记忆的人类画像增强检索优化框架
- 从惯性到客观:通过噪声隔离改进深度研究智能体
- 智能体脚手架会放大大型语言模型的谄媚行为
- 权重中被遗忘,工具中被找回:大模型智能体的工具去学习
- EDGE:智能体强化学习中引导式探索的经验蒸馏框架
- InjecMEM:针对大模型智能体记忆系统的内存注入攻击
- MOSAIC:面向结构化智能体与组合的模块化编排框架
- MetaRAG:面向智能体RAG的信念-动作对齐策略优化
- 交接税:LLM 智能体中延续非原生轨迹的代价
- 大语言模型智能体的工具创建与使用联合优化
- Meta\(^n\):通过涌现深度实现递归自我提升
- 适得其反的反馈:为什么小型语言模型智能体总是重复刚目睹失败的函数调用
- 智能体何时应当停止?面向工具使用型大语言模型的证据携带式终止机制
- 知道何时寻求帮助:分层LLM智能体中的贝叶斯自我升级
- Eluna:用于自动化仓库运营的推理与任务执行智能体系统
- 训练知识库:面向智能体策展文档库的监督式结构学习
- 分子大模型智能体:从架构设计到科学自主
- 更智能的验证,更深度的进化:通过行为感知验证实现高效的智能体框架演进
- DSA:面向多市场股票研究的证据感知型大模型智能体编排框架
- 朴素提示词优化:重新审视复杂提示词搜索的必要性
- ASIL:用结构化状态与语义动作取代截图点击式交互
- 更聪明的验证,更进一步的演进:通过行为感知验证实现高效的 Harness 演进
- Behavior2Trip:基于用户行为轨迹迈向个性化旅行规划
- 数字EDA中的大语言模型:从生成到编排的角色转变视角
- SWE-Prime:更少的轨迹,更优的性能
- RedEvoAgent:基于经验驱动技能演化的自动化红队测试智能体
- 从惯性走向客观:通过噪声隔离提升深度研究智能体的性能
- Logos:基于跨进程总线的智能体运行框架
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 大语言模型中的长视界状态追踪:通过深度依赖工具调用链执行MD5
- 一种策略,适应任意预算:通过强化学习内化预算感知搜索
- 精修却未决:识别长程工具使用智能体中的后期压力状态
- Analog-DB:面向Agent的模拟集成电路数据库,从模块到系统
- AutoXRD:用于粉末衍射分析的自主大模型智能体与综合评测
- 智能体强化学习中的技能复用与压缩
- 通过复杂度提升强化学习实现奥林匹克级别的几何大语言模型智能体
- KC-Bench:用于评估大模型智能体中知识冲突的动态交互式基准
- 语义贝叶斯世界模型
- DRACO:基于动态评分标准的长期智能体训练细粒度信用分配
- 通过人机交互实现高效测试时适应
- StrixAE:面向真实场景复杂失真耦合的音频增强智能体
- CoMAP:用于大语言模型智能体的世界模型与智能体策略共同演化框架
- MaxKernel:面向 TPU 的智能体内核生成
- 智能体上下文破解:通过非结构化数据的自适应构建实现Token高效的数据推理智能体
- 记忆究竟何时有用?工具调用大语言模型智能体中长期记忆的成本感知评估
- 大语言模型交易智能体在生产环境中的实际表现:来自两个机群的长达六个月、群体规模的实录
- 超越提示词:大语言模型工具智能体外挂框架的度量与优化
- MOSAIC:用于跨范式智能体混合与人机协作的通用智能体级接口
- 元认知引导:学习科学判断的内在结构
智能体AI
- 当智能体AI遇见通感一体化
- 基于技能的智能体AI系统中的动态联盟形成与通信定价
- 教会智能体AI学习罕见病诊断的专家推理能力
- 利用智能体AI、嵌套学习以及通过语义缓存实现AI可持续性来缓解幻觉问题
- 基于静态分析引导的智能体 AI 翻译:使 Rust 成为全栈生物信息学语言
- 面向智能体AI的运行时治理:具有可信溯源与故障安全执行的动作边界控制
- 单一网关远未足够:为智能体AI组合有状态的前置动作控制
- 朴素提示词优化:重新审视对复杂提示词搜索的需求
- 智能体AI系统的价值保留架构
- 从语言模型到世界行动系统:智能体AI在数字、社交、虚拟与物理环境中的进展与局限
- SoK:AI 增强型二进制逆向工程知识系统化研究
智能体RAG
智能体优化
智能体决策
智能体反思
智能体可靠性
智能体后训练
智能体基准测试
智能体外壳
智能体学习
智能体安全
- 大语言模型智能体系统中潜在妥协的组合威胁分析:66号令场景
- 大语言模型智能体中的后门净化动态学
- 熟能生巧未必安全:自进化大模型智能体中的技能错进化现象
- PIPES:通过溯源与先验知识保障智能体感知安全
- 基于图结构的强化学习框架:用于自主LLM智能体的结构化漂移诊断与恢复
- 迈向安全的LLM智能体:规范、验证与执行综述
- 有界智能体:多智能体AI系统的委派安全性
- GraphWake:基于大模型智能体社区中记忆介导的极化级联效应引发群体极化
- 在上下文之前授权:针对智能体系统中跨受众内存泄漏的模型中立受众边界
- ProvenanceGuard:基于模型上下文协议(MCP)的大模型智能体源感知事实核查机制
- 大模型作为裁判并非全知全能:为什么自我进化智能体需要确定性防护栏
- 多模态GUI智能体是否知道何时停止操作?实现具备冲突意识的终止机制
- 将间接提示词注入重新构想为测试时搜索问题
智能体审计
智能体对齐
智能体工作流
智能体工具
智能体工程
智能体建模
智能体归纳
智能体意图层
智能体技能
- 当经验化为指令:自进化智能体技能系统中的轨迹投毒
- SkillReason:针对隐式用户请求的推理增强型智能体技能检索
- SkillConsist:通过双向图对齐检测智能体技能中的不一致性
- 智能体技能也可能带来负面影响:大模型智能体中技能引发故障的实证研究
- CompoSkill:由单个扫描通过的LLM智能体技能构成的组合式技能链攻击
- 自动策略,而非自动技能:物理世界的编译型智能体技能
智能体探索
智能体推理
智能体提取
智能体插件
智能体架构
- 智能体安全性应当是一项运行时契约
- 受控持久化内存:面向长周期智能体的源绑定状态语义与故障关闭释放机制
- 当故事演进时:开放式世界模拟中大语言模型叙事能力的基准测试
- 从多智能体到单智能体:什么时候技能蒸馏才真正有效?
- Dalek:构建式智能体机器
- 面向嵌套企业级架构的成本感知自然语言转SQL智能体架构与全新基准测试
智能体框架
- EviDx:基于脚手架大模型智能体的证据感知主动诊断框架
- Harness-of-Harness:实现具备持续改进能力的多天自主软件开发
- CordisBench:语言模型能否在动态智能体运行框架中进行组件生命周期推理?
- 适应不断演变的需求:用于零售供应链运营的智能体化 AI
智能体检索
智能体沙箱
智能体环境
智能体研究
智能体程序
智能体系统
- 基于大语言模型的智能体化软件缺陷修复:综述
- VALG:用于机器学习理论研究的智能体系统
- 并非所有 Token 都是平等的:面向智能体 LLM 系统的感知通胀路由
- 分歧-收敛推理:通过结构化解决方案合成扩展测试期计算
- AstronOS:面向长视野智能体系统的统一执行模型与运行时
- 环境、智能体及联合智能体-环境系统的世界模型
智能体编排
智能体编程
智能体网络
智能体群体
智能体脚手架
智能体自动化
智能体自我修正
智能体规划
智能体记忆
- 活动帧:用于智能体记忆与回放的确定性屏幕活动编译
- TEPA:为抗冲突语言智能体撤销陈旧记忆
- 效用遭受攻击:智能体记忆投毒与内容筛选及溯源排名的局限性
- Zeta-Lite:面向智能体记忆的并发、可分支浏览器内 SQL 数据库
- 继承式智能体记忆预算验证中的计划指针与记录指令形式
- 已被撤销却依然具备权威性:对智能体记忆系统中撤销执行情况的实证研究
- 扎根智能体记忆:面向企业级智能体的环境探测式记忆管理
智能体评估
- AV-AIVAT:基于不完全信息博弈中认证随时有效停止机制,将智能体评估成本降低 74 倍
- OSReward:建立跨平台电脑操作智能体奖励模型的标准化评估体系
- 衡量语言模型智能体中的跨任务行为一致性
- Wuying-Browser-Agent:面向真实世界的长周期基础浏览器智能体
- 当护栏看似有效时:LLM智能体商业评估中的构念效度失效
- 主动式服务智能体:统一的决策框架、方法与评估
- FinalityBench:评估智能体在延迟与冲突金融终局性下决策的效果级基准
- Harbor Adapters与Harbor-Index:大规模智能体评估的基础设施与精选元数据集
智能体评测
智能体调度
智能体轨迹合成
智能体运行时
智能体通信
智能体隐私
智能制造
智能医疗
智能合约
智能填表
智能实验室
智能客服
智能家居
智能旅游
智能机制
智能电网
智能科学
智能调度
更新掩码
替代梯度
最优传输
最优停止
最优输运
最大后验估计
最小描述长度
最短路径问题
最近邻分类
有向无环图
有理插值
有理数
有限元分析
服务器命名
服务市场
服务管理
木卡姆
本体学习
本体工程
本体推理
本体论
本体论信任
本地大模型
本地模型
本地部署
机制可解释性
- 点火指数:衡量语言模型中的全局工作空间动力学
- INTRYGUE:基于归纳感知的熵门控机制实现可靠的RAG不确定性估计
- 并非所有评测觉察都千篇一律:能力框架可预测合规性
- 并非所有的评估感知都生而平等:能力框架预示着合规性
- 自发欺骗与受指令欺骗中的不对称性
- 听见却未听取:音频-语言模型中的副语言信息编码与丢失
- 表征干涉的驱动力是什么?关于干涉模型拒绝机制的机制性案例研究
- 视觉语言模型是在阅读还是在重写?探究视觉语言模型中的转写忠实度
- 超越迁移准确率:面向低资源语言的机制引导受控自适应
- 思维链失效时,解法隐藏在隐状态中
- 追踪音频大语言模型中的音频基础与答案选择机制
- 续写与拒绝的博弈:大语言模型中续写触发型越狱的机制分析
- 大语言模型中战略选择的内部解剖
机制模型
机制理论
机制研究
机制表征
机制解析
机制设计
- 资源化权威:部署态AI智能体参与式治理的机制设计模型
- 保留、定制还是退出:LLM推理服务中的默认设计与代币定价
- LLM智能体能进行理性谈判吗?基于A2A/MCP协议的可验证多智能体交互机制设计框架
- 超越文本记录:检测潜在多智能体通信中的隐蔽协同
- 算法影响揭示对齐中隐藏的社会选择结构
机器人任务规划
机器人学
- Dream-MPC:基于潜在想象的梯度模型预测控制
- AutoIntervene:面向动作分块模仿学习策略的校准式干预方法
- 不会“跑偏”的AI科学家:四足机器人导航研究循环中的学术品味、结构化设计与可证伪发现
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量化无人机导航潜能
- 开放世界分层感知:基于类别无关提议的分类抽象,实现对词表外道路物体的安全处理
- 从世界模型到世界行动模型:机器人学简明教程
- FACT:世界-动作模型的故障感知因果训练
- 使用 Strands Agents、LeRobot 和 Hugging Face 存储桶在单一平台完成录制、训练与部署
- 刻意练习:在预算限制下学习机器人技能
- AtomBridge:面向科学实验长程任务的智能体化 VLA 推理插件
- 被动物体状态世界模型中运动学、接触及物体恒存场的事件条件诊断
- 低秩动力学有效潜在载体:用于学习世界模型中反事实推演的方法
- 在仿真中预训练视觉灵巧操作
- 结合世界模型的Q学习 (Q-Learning With World Models)
- GS-VLA:基于高斯溅射的冻结 VLA 策略即插即用视点归一化
- 纠正学到的物理不变量可改善世界模型的前瞻推演
- Meta-Ctrl:通过解耦语法与语义约束实现有保证的计划生成
- 带着意图行动:为视觉-语言-动作模型蒸馏行为意图
- 轴心与站点多智能体路径规划:可解性、复杂性与算法
- 通过算法与超参数的SHAP分析增强机器人强化学习的泛化能力
- 残差奖励模型:利用先验知识实现机器人领域高效基于偏好的强化学习
- 在仿真中进行灵巧手操作的预训练
- 基于类别的启发式选择算法求解飞行积木拼图
- PanelShield:面向机器人工业面板操作的可验证闭环安全规划
- REFACTOR-VLA:类型化运动程序的无监督库学习
- 高维POMDP的可扩展Rao-Blackwellized在线规划
- 物理实验室的可计算表示助力可验证工作流
- FailBench:视觉语言模型在判断机器人任务成功率方面有多可靠?
- 迈向面向目标条件化机器人规划的物理基础 JEPA 世界模型
- 抓住关键时机:诊断与提升视动模仿策略中的条件视觉基础定位
- Octopus 协议:通过“提示词即基础设施”实现面向 AI 代理的一次性硬件发现与控制
- ARC-Bench:闭环重规划掩盖了冻结 JEPA 世界模型中失效的动作排序
机器人学习
- Grabette:用于录制机器人操作数据的开源系统
- LeRobot v0.6.0:想象、评估、改进
- TMRL:扩散时间步调制预训练助力高效策略微调
- Max-Q 选择性模仿:用于人机协同在线机器人学习
- 运行级数字孪生诊所:实现具身智能基于任务的评估
- WM-R1:通过强化学习训练具备推理与世界模型利用能力的GUI智能体
机器人安全
机器人导航
机器人开发
机器人感知
机器人技术
机器人控制
- 四足机器人运动的快速具身自适应
- SoRoMoX:快速、可微分且可并行化的软体机器人模型
- 通过神经符号安全卫士引导端到端自动驾驶
- MistyPilot:通过多智能体大模型技能编排实现社交机器人控制
- 解耦规划与控制:面向可指令智能体的 Instruct-to-Act 系统
机器人操作
- Reflex:为反应关键型操作打造快速且具预测性的视觉-语言-动作模型
- GaussMemory:面向长序列机器人操作的任务驱动型 3D 高斯场景记忆
- Pointing-VLA:面向视觉-语言-动作操作的类型化空间基础接口
机器人操作系统(ROS)
机器人检测
机器人灵巧手
机器人自主系统
机器人规划
机器人诊断
机器去学习
机器学习
- Otter:一款具备时间感知与历史上下文的人类国际象棋 AI
- 从连续预测变量到临床阈值:基于指南的分类法在缺血性卒中预后预测中的性能权衡研究
- 基于Volve油田的基础井况异常检测:构建标签、基线模型与双头模型
- 面向放牧生产系统的牛群生长模式与增重预测混合机器学习框架
- GAUGE:面向不完整多模态分类的粒度自适应反事实证据门控
- 自监督预训练对于提升医疗时间序列诊断真的有用吗?
- 面向编码智能体的全局可重用技能学习
- 基于可微分D-vine Copula的局部化异常检测
- FI-TW:用于芬兰铁路晚点分析的开放列车天气数据集
- MARS:用于奖励建模的边界与语义感知数据增强
- InferQ:面向量子电路模拟的数据库基准测试
- Dream-MPC:基于潜在想象的梯度模型预测控制
- AWS 上的基础模型训练与推理构建模块
- PyTorch 性能剖析(第一篇):
torch.profiler新手入门指南 - gradio.Server:结合 Gradio 后端与任意自定义前端
- QFCQT:用于高波动性时间序列预测的混沌门控量化变压器框架
- KReF:用于长期时间序列预测与预测不确定性的免训练检索框架
- 通过 Nyström 方法弥合超维计算与核方法的鸿沟
- 基于决策树剪枝的可解释强化学习
- FUSE:面向混合类型表格流匹配的跨列交换特征级统一专业化方法
- AI智能体能否进行开放式AI研究?两项案例研究的初步证据
- 主动推断生成模型的重整化:基础、推导与验证
- 基于SSMD的高通量筛选测定机器学习性能指标与苗头化合物选择
- PRISM:通过地形诊断进行排列优化的预测性协议
- HyperANFIS:通过双曲几何增强自适应神经模糊系统中的规则表示与可解释性
- 针对组污染结构化结果的因果推断:可观测商、无损约简与精确随机化推断
- TailBooster:用于极限值增强与操作有效性强制约束的双层生成式框架
- HYDRA:科尔莫哥洛夫-阿诺德网络的双曲动态表示架构
- 大概率近似正确最大后验推断
- 评估条件训练:教导模型泛化至更强的监督机制
- AI天气模型是否会忽略极端天气?
- 基于层论的联邦表示学习
- 从预测到增量:大规模目标定位与推荐的因果优化
- ELVAE:基于证据学习的变分自编码器用于不确定性感知的生成
- 你的 KV 缓存不是比特问题,而是几何问题
- 我们通过复现2200篇ICML论文学到了什么
- 预测性记忆定位:从内部信号预测选择性干预路径
- 扰动响应中证据、矛盾与脆弱性的分解
- 快速 A/B/n 测试:通过树耦合反馈共享实现精确的多策略比较
- 目标函数才是瓶颈:潜在世界模型编码了其规划器无法使用的信息
- Vero:AI智能体能够构建形式化验证的软件代码库吗?
- 大规模遗忘:数十亿参数语言模型中的状态精确且保留轨迹的删除
- SAFE-SVD:面向物理基础模型的敏感感知保真度强制奇异值分解
- 维度平衡提升大规模时空预测性能
- 黎曼流形上比例类比的广义平行四边形法则
- AI科学家的过去与未来
- Tripwire:通过统计认证的安全神经元触发对齐拒绝机制
- SAGE:基于注意力引导熵的脉冲Transformer替代梯度自适应方法
- 分工协作:将证据解释与决策聚合解耦
- PPAPlace:用于芯片布局优化的可微跨阶段目标函数
- CutClean:面向隐私保护推理的神经网络剪枝方法
- 结晶材料的通用热力学原子间势
- RecipeNet:面向配方数据的分层 Transformer 架构
- 考虑对交通流影响的道路养护作业优化调度
- 气象驱动的垃圾填埋场无组织排放因果临近预报:助力主动公共卫生响应
- 快速 A/B/n 测试:通过树耦合反馈共享实现精确的多策略对比
- 基于大语言模型智能体及列间约束发现的约束感知合成表格数据生成
- PLeDO:基于电子病历数据的骨关节炎疼痛程度检测
- 概率电路:人工智能中的推理机器(第一部分)
- 前向传递域自适应(无需跨层反向传播)
- 通过数据规模化突破高分辨率天气预报的极限
- FedImp:基于杂质度加权的联邦学习收敛性增强
- 用于论证分析的逻辑嵌入
- RetroMPA:用于增强逆合成预测的分子属性感知辅助框架
- AsyTO:用于参数高效的多变量时间序列预测的不对称时间算子
- 基于推理的编译至可微分电路:实现基于OWL 2 DL的神经符号学习
- 何时复习:语言模型持续预训练的间隔重复机制
- 大语言模型能解释飞行安全事件吗?一种先验引导的语义大模型方法
- 从基函数的视角重新审视不规则时间序列预测
- MotoSafety:利用学习型时间重要性在时间压力下进行两轮车碰撞风险评估的边缘AI
- SIGMA:面向无元数据 LLM 自动特征工程的 SHAP 引导隐式轨迹生成
- TSQueryBench:用于时间序列解释的大模型裁判评测基准
- GenEx:通过密码子共现网络进行SARS-CoV-2变异株检测的基于图的表征范式
- 候选状态记账法:实现透明的传感器诊断流水线搜索
- 面向无线场建模的物理展开神经算子
- MorphoGP:预测潮汐影响下平衡海滩剖面的非参数框架
- RouteCost:一种受生产实践启发的电商预购运费估算多阶段框架
- 不可训练元件决定了物理学习的记忆内容
- 揭秘数据受限下语言模型预训练的训练时数据增强
- 动态上下文调度:超越静态宇宙的学习
- SENTRY:面向IT变更管理的确定性智能风险评估
- BF1:面向高效长文本 Transformer 的因果二元稀疏注意力改造方案
- 归因光谱基础模型中的预处理不变性
- 神经影像分析中的SPD矩阵学习:视角、方法与挑战
- DFM Mimir v1:仅使用合规后训练数据、在10亿参数规模下实现前沿性能的开源HRM模型
- 用双判别器分离协变量漂移与机制变化:具备精确协变量-概念分解的条件差异度指标 CJSD
- 模型坍塌与应对策略综述
- 量化地理域偏移以解耦人类移动流生成模型的空间可迁移性
- 使用 QHAdamW 优化空气质量预测中的增强型人工神经网络
- 时间序列分类中可解释人工智能的软件框架:系统性综述
- 自动驾驶课程学习的规模化扩展
- CAI-DLLM:扩散语言模型的收敛感知推理
- 修正随机森林的变量重要性评分
- 针对未见问题的LLM评估:上下文多维项目反应理论模型
- 使用变分推断联合发现因果结构与聚类
- 稀缺验证性PET测量的合理分配:A4/LEARN中的目标对齐验证
- 面向黑盒大模型分类推理的层级感知监督不确定性估计
- 正则化在平均化后能保留多少?联邦学习中的更新掩码机制
- 检索对齐的表格基础模型:在真实世界约束下实现电子健康记录的稳健临床风险预测
- MOSAIC:面向结构化智能体与组合的模块化编排框架
- 关系型结构因果模型
- 开放世界多智能体环境中的自主数学发现
- 语义叠加:超越Token与控制向量的提示词注入防御技术
- 数据混合作为混合实验:大语言模型预训练的响应面方法与最优设计
- 基于血缘引导的演化概念定义下的增量学习
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越正则化方法
- 利用神经算子学习 Kohn-Sham 映射以实现准线性标度的密度泛函理论
- 完美拟合与虚幻最优:数据驱动模型如何在实时优化中失效
- 监督式不确定性量化集成何时能提升大模型幻觉检测能力?一项鲁棒性研究
- 单调且可分离的集合函数:特征刻画与神经模型
- EEG基础模型的测试时适应:现实世界分布偏移下的系统性研究
- 离散扩散模型:从分词到生成的统一框架
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越者正则化
- 基于游戏轨迹的账号一致性:《反恐精英2》中的同名玩家验证
- CG4AI:一种用于约束条件下训练 AI 模型的列生成框架
- 潜诊断分类法:构建分类器及诊断其决策的框架及其在提示词注入检测中的应用
- 语言模型如何组织与构建道德知识
- 超越 F1 分数:评估 AI 模型安全扫描器的覆盖率与故障恢复能力
- 扩散模型原理
- 漂移自适应ICU干预预测:冻结生理编码器以实现可审计的模型更新
- 基于游戏轨迹的账号一致性:反恐精英2中的同玩家验证
- 面向超大规模电商的时效感知复购预测:多界面生鲜推荐的生存分析模型
- 基于曲率感知半径收缩的自适应最近邻分类
- 超越搜索模仿:免搜索国际象棋的先验导向探索
- 条件流匹配何时可以替代逐点负对数似然?
- 语义叠加层:超越词元与引导向量的提示词注入防御新范式
- 基于图结构电子占据离散流匹配的机理反应预测
- LongDS-Bench:长周期智能体数据分析失败机制研究
- 锁定的评估表面:CRISPRi 扰动效应预测中的迁移失败与采样深度纠缠
- 介绍 @huggingface/kernels:面向本地 AI 的 200 多个 WebGPU 核函数
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 自由派生,审慎行动:递归大模型智能体树的渐进风险归属机制
- 当特征成为样本:用于无监督特征选择的倒置对比学习
- 廉价验证器与巨大的盲区:衡量降本级联的可靠性代价
- 通过激活匹配微调检测大语言模型中的隐藏行为
- 无梯度自适应:仿射统计迁移及其证书的启示
- MADS:超越标准频谱汇总的多视角声学描述符集
- 用记忆替代训练:Text-to-SQL 的列表式选择方法
- 生产环境中的多臂老虎机:推理时超参数优化
- DiffIE:基于扩散模型的开放式信息抽取
- 基于大语言模型的自适应岛屿图演化自动特征工程
- 生产环境中的多臂老虎机:推理时的超参数优化
- AutoGraphForge:迈向图论的自动化发现
- 药物毒性预测中提示词工程的分析研究
- 一种计算上可行的因果概率解释框架
- 丹麦树种测绘:光谱时间特征与地理空间基础模型嵌入的对比
- 见证者解释异常:WAND——具备原生可解释性的无监督表格异常检测器
- 数值数据可解释异常检测的可微区间瓶颈
- 基于未纠正几何畸变影像的卫星机载甲烷检测技术
- 相变频率作为 ResNets 测试准确率训练阶段预测指标
- 更少数据、更快训练:重复较小数据集通过采样偏差加速学习
- 语义叠加:利用超越Token和引导向量的注解技术缓解提示词注入
- LLM因果先验何时以及为何有效:面向摊销因果推断的闭环先验选择
- 工业制造系统中用于多时域预测性维护的分位数引导特征提取
- 脱离引擎的评分:端到端验证生成式引擎中确定性且抗操纵的内容评分
- 基于值函数的强化学习中批归一化前向模式的研究
- 离线强化学习中扩散策略的噪声空间策略梯度
- steering 干扰反映了模型的默认倾向,而非行为方向本身
机器学习优化
机器学习公平性
机器学习基础设施
机器学习天气预报
机器学习安全
机器学习工程
机器学习理论
机器学习系统
机器学习评估
机器推理
机器智能
机器生成内容
机器翻译
- 缓解英语到罗马尼亚语机器翻译中的性别偏见
- 评估指标能检测出文言文到英文翻译中的错误吗?
- SuTRA:具备词根感知能力的结构统一分词算法
- OmniFusion:基于模块化融合的端到端多语言多模态同步翻译
- 通用语假设:大语言模型通过潜在的、与任务无关的特征空间进行翻译
机器证明
机器遗忘
- 大规模遗忘:数十亿参数语言模型中的状态精确且保留轨迹的删除
- RULER:机器遗忘的表征级验证
- 科学声明能从大语言模型中移除吗?声明级遗忘的系统性评估
- 基于良性事实的强化学习会放大对已记忆隐私数据的泄露
- BLADE:大语言模型遗忘的双层低秩增广拉格朗日擦除方法
- 遗忘不等于简单擦除:基于生成不等式的时序解耦
- “无瑕”之心铭记什么:知识纠缠如何塑造大模型遗忘后的信息泄露
- 坦白你所知:大语言模型遗忘中“遗忘集与模型知识错位”问题研究
机场陆侧
机构声望
机构级审计
机械可解释性
- 通过分块 SVD 寻找可用的权重机制
- 作为攻击目标与对抗者的扩散大语言模型:机理性安全漏洞
- 大模型拒绝机制中的对称性破缺:答案释放比恢复拒绝更具局部性
- 已编码但无法利用:冻结大语言模型中几何约束的“解码-生成-引导”鸿沟审计
- 语言模型认为谁更有能力?职业偏见的机械可解释性分析
- 用机械可解释性解释内在的道德自我修正
- 为什么鲁棒性会减少叠加?
- RACE:大语言模型神经元功能一致的可扩展统计估计
- 离散对数时钟:Transformer 如何学习模乘法
- 从检测到拒绝:通过电路引导的权重缩放构建更安全的大语言模型
- 语言模型智能体能成为机械可解释性中得力的电路解释器吗?
- ObserverBench:测试用于干预和控制的机械解释估计器
- 早期编码、后期调用:Transformer在何时开始依据推断出的伙伴专业性采取行动
- 真相从未泯灭:顺从上下文真实性探针中的完全混叠现象
机械键盘
机理分析
机理反应预测
机理可解释性
- LLaMA 3.1 8B 中结构感知数值推理的机理可解释性研究
- 通过几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性
- 是一个电路,而非那个电路:Mamba-2 状态汇聚的非唯一因果定位
- 解码前拒绝:检测与利用大语言模型中间激活中的拒绝信号
权重修改
权重分析
权重差分
权重消融
权重空间
权限控制
权限管理
材料合成
材料科学
- AutoMOOSE:用于自主相场模拟的智能体AI
- DREAMS:基于密度泛函理论的智能材料仿真研究引擎
- 结晶材料的通用热力学原子间势
- 通过可解释神经网络揭示纳米晶合成的尺寸决定机制
- 从实验与模拟的不一致中发现物理机制
- AutoXRD:用于粉末衍射分析的自主大模型智能体与综合评测
- 在开源大语言模型中读取与调控材料科学机制的表征
- 人机协同发现可重构面内铁电超畴控制
杜绝幻觉
条件互信息
条件合作
条件流匹配
条件潜空间扩散
条件熵
条件相关性
条件解码
极端上下文
极端值分析
极端天气
极端天气模拟
极长上下文
极长视频
构念效度
架构优化
架构分析
架构创新
架构对比
架构感知
架构映射
架构模式
架构简化
架构规范
架构解耦
架构设计
- Compiler Explorer 2026 年 AWS 架构与运行内幕
- SigV4 认证:意料之外的复杂性
- gradio.Server:结合 Gradio 后端与任意自定义前端
- 何时选择只读副本(Read Replicas)与更大计算资源(Bigger Compute)
- 开放数据标准:Postgres、OTel 与 Iceberg
- 大规模 Git 架构演进:Cursor 的 Continuity 架构解析
- Hugging Face Inference Endpoints、Jobs 和 Buckets 如何驱动 Papers with Code 的搜索功能
- String:一个让每个应用皆为 Markdown 文件的智能体操作系统
- Agentao:面向嵌入式工具使用大模型智能体的策略治理运行时框架
- 微小体量,巨大影响:大型语言模型中的缩放向量研究
- 运行时独立的持久化智能体:跨模型、框架与服务器保持身份、记忆和代码的连续性
- 预测编码网络中隐藏状态优化顺序的研究
- 文明框架:个人多智能体系统间基于主权锚定的通信
- 思考模型:授权与能力
- 面向目标导向对话编排的可审计符号-RAG-生成式AI架构
- 当智能转化为能动性:共生式AI系统的受控主动能动性理论
架构趋同
架构迁移
架构重构
查找表(LUT)
查询优化
柯尔莫哥洛夫复杂度
标准库
标度律
标杆测试
标注流水线
标记动力学
标记化
树搜索
树状搜索
树种分类
树结构
树莓派
校准算法
样本复杂度
样本效率
核方法
根因分析
根本原因分析
格罗滕迪克常数
格论
框架依赖
框架对比
桥梁检测
梯度优化
梯度保真度
梯度归因
梯度提升树
梯度操纵
梯度比率掩码
梯度饥饿
检测规则
检索与生成
检索优化
检索增强
- KReF:用于长期时间序列预测与预测不确定性的免训练检索框架
- 少读多解:面向AI智能体的Token高效稀疏阅读技术
- 将文本属性图学习中的消息传递重新构想为检索
- 用记忆替代训练:Text-to-SQL 的列表式选择方法
- 每次都能完美掌控十七:企业数据分析的受控方法
- FastE:基于读出触发的 LLM 嵌入推理 Token 压缩算法
检索增强生成
- TS-RAG:用于时间序列预测的检索增强生成
- 面向工业因果推理的模拟器基座大语言模型:污水处理决策支持中的工具调用、结构化注入与厂间可移植检索
- InsightEmb:学习用于智能体洞察检索的动作-意图嵌入
- SkillReason:针对隐式用户请求的推理增强型智能体技能检索
- 抵御知识投毒与提示词注入的检索增强型入侵检测防御机制
- REVEAL:用于长视频问答中显式证据充分性验证的评分标准引导智能体
- AkasicDB:基于统一向量-图-关系型 DBMS 演示全能检索增强生成(Omni RAG)
- LakeQuest:跨数据湖基础问答的三域基准测试
- RAGas:结合持续知识集成的智能合约检索增强Gas优化方案
- GRIP:基于信息受限前提的扎实推理
- CoAL-RAG:一种兼顾复杂度感知的法律检索增强生成方法
- Search-G1:基于表征内在奖励的扎根搜索智能体
- EgoCITE:面向长时序第一视角记忆的上下文增强索引与时间感知检索
- SAGE:SQL中AI函数的统一代数与自适应执行
- Ansari:一个基于检索增强的伊斯兰AI助手——14万次对话的架构、部署与经验教训
- 当故障发生扩散:智能体检索增强生成中的因果故障归因
- SchemaRouter:面向高效异构智能体 RAG 的字段感知工具路由
- HIRA:面向受监管行业文档分类的人机协同检索增强级联系统
- 粗粒度索引,细粒度证据:长视频RAG中时间粒度的解耦
- 检索对齐的表格基础模型:在真实世界约束下实现电子健康记录的稳健临床风险预测
- 医疗大语言模型因果知识图谱接地框架:心血管领域试点研究
- MARS:面向竞技编程的多专家大模型接力系统
- 超级智能检索代理:Agentic 检索的下一个前沿
- 训练知识库:面向智能体策展文档库的监督式结构学习
- pro-team 在 LLMs4OL 2026 的表现:用于本体学习的检索增强生成与词汇约束过滤
- TriShieldRAG:检索增强生成分层防御中的三层护盾与盲区
- post-graph-rag:原生于 PostgreSQL 的图 RAG 引擎
- SIMGUIDE:基于程序化落地的多上下文表示法,赋能个性化智能体规划
- pro-team 参加 LLMs4OL 2026:基于检索增强生成与词汇受限过滤 本体学习方法
- 为什么RAG会产生幻觉:引入“知识缺口金丝雀”的检索增强生成系统惩罚感知评估
- TriShieldRAG:检索增强生成分层防御中的三重防护网与一个盲点
- SIMGUIDE:基于程序化落地的多上下文表示,赋能个性化智能体规划
- ISO-RAG:用于检索增强生成等周噪声控制方法
- 一种策略,适应任意预算:通过强化学习内化预算感知搜索
- 学会记忆:面向长文本推理的记忆智能体端到端训练
- DKL:面向指令微调语言模型的解耦知识学习方法
- 通用型AI助教中构建可扩展、灵活且实时的混合微观个性化提示工程方法
- 大语言模型中的证据整合机制
- Qlippy:一个用于可复现量子工作流与实验追踪的检索增强型生成式AI助手
- 超越单次扩展:面向多跳检索的对比证据探索
- 通过基于SAE的引导解决知识冲突的关键路径识别
- 已被撤销却依然具备权威性:对智能体记忆系统中撤销执行情况的实证研究
- VikingRAG:面向结构化文档的高精度与高 Token 效率检索增强生成
检索扎根投票
检索评估
检索重排
棋局预测
棋类博弈
棋类程序
森林监测
椭圆型偏微分方程
概念探测
概念漂移
概念瓶颈
概念瓶颈模型
概率分布
概率匹配
概率图模型
概率对齐
概率布局
概率建模
概率推断
概率推理
概率机器学习
概率电路
概率计算
概率论
概率预测
模乘法
模仿学习
- AutoIntervene:面向动作分块模仿学习策略的校准式干预方法
- 从专家演示中进行奖励分配的最小化要素
- 不求甚解的盲目模仿:大语言模型中决策偏差的根源
- Max-Q 选择性模仿:用于人机协同在线机器人学习
- 在仿真中预训练视觉灵巧操作
- 在仿真中进行灵巧手操作的预训练
- 面向微型阿克曼车辆端到端自动驾驶的低成本开源平台
模仿游戏
模块化学习
模块化架构
模块化融合
模块化训练
模型-RB基准
模型上下文协议
- 超越 Top-K:用可解释的智能体操作替代黑盒检索
- MCP 中的大语言模型至关重要:衡量由大语言模型驱动的低效资源利用
- 脚手架的重要性胜过接口:对七种智能体脚手架、五种语言模型以及一项软件任务中 MCP 与 CLI 工具调用的对照比较
- PHMForge:通过基于 MCP 原生、算法扎根的工具评估大模型智能体在工业预测与健康管理(PHM)中的表现
- ProvenanceGuard:基于模型上下文协议(MCP)的大模型智能体源感知事实核查机制
- 从 MCP 注册表中随机抽取究竟能抽到什么?工具调用基准测试真相剖析
模型不对齐
模型不确定性
模型个性化
模型互操作性
模型交接
模型优化
- 超越LoRA:你能打败最流行的微调技术吗?
- IFCLoRA:面向参数高效微调的拓扑感知秩分配方法
- 通过年龄感知训练实现儿童语音的边缘端音素识别
- XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链
- Transformer 需要三个投影吗?QKV 变体的系统性研究
- Wiola 13M:面向参数高效小型语言模型的门控螺旋注意力架构
- BF1:面向高效长文本 Transformer 的因果二元稀疏注意力改造方案
- 大语言模型智能体的工具创建与使用联合优化
- 微小体量,巨大影响:大型语言模型中的缩放向量研究
- ACE:MoE大语言模型参数高效微调的跨专家适配器合并
模型偏好
模型偏差
模型偏见
模型公平性
模型几何学
模型分析
模型剪枝
- 基于决策树剪枝的可解释强化学习
- 轻量级微调下的路由器敏感性识别混合专家模型中的可剪枝专家
- 谱奇异值揭示了Transformer注意力机制中占主导地位的学习结构
- 通过激活引导剪枝实现跨模型规模的无训练知识迁移
- CutClean:面向隐私保护推理的神经网络剪枝方法
- 你的注意力指标究竟在回答哪个问题?作为成分数据的注意力行
- 任务特定大语言模型蒸馏的缩放定律
- 图像分类神经网络中,权重高的神经元一定重要吗?
- 面向视觉与语言Transformer的感知损伤多臂老虎机剪枝技术
- 超全训练,紧凑部署:扩展结构化大语言模型剪枝的恢复能力
模型加速
- LoSA:无需训练的视频扩散模型加速:近乎无损的稀疏注意力机制
- CacheSpec:在大语言模型中为小模型寻找最佳平衡点
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- GeoSPRINT:扩散轨迹推理中基于几何冗余感知的步数剪枝
- Shiva-DiT:用于高效扩散 Transformer 的基于残差的可微分 Top-\(k\) 选择方法
模型升级
模型压缩
- 大语言模型生成式推理中层剪枝的局限性探究
- 大型语言模型中的量化退化:信号与噪声的视角
- 理解大语言模型免训练低秩压缩中的校准与截断误差传播
- 基于本地视听动态的全能大模型延迟音频修剪技术 (A-PACK)
- KVDiagnosis:长文本大语言模型中 KV-Cache 压缩的诊断基准
- 从单向扫描到边界缝合:交错式跨块后训练量化
- HYDRA:科尔莫哥洛夫-阿诺德网络的双曲动态表示架构
- SAFE-SVD:面向物理基础模型的敏感感知保真度强制奇异值分解
- OTIS:使用微型编码器学习高质量时间序列特征
- 面向小型设备的超大模型:边缘AI部署的近期进展与实证分析
- 运行时压缩风险定价:压缩服务状态的随时有效准入与服务输出定律
- MAPLE:MoE 自适应即插即用层级专家分配框架
- FluxBin:通过算法与算子协同实现基于灵活查找表的超低比特大模型推理
- TinyCast:基于计算周期的概率化零样本预测模型
- 熵约束自适应随机量化
- 感知量化修复:恢复压缩版 4-bit 大语言模型的实用方法论
- 量化感知修复(QAH):一种超越全精度原型的压缩4比特模型
- SplitLite:用于拆分学习的低秩残差压缩技术
- Minima-KV:采用混合格式分页注意力的保持保留型 KV 缓存压缩技术
- 大语言模型还能解释自己吗?量化对自解释影响的研究
- 频率至关重要:用于剪枝与量化的快速模型无关数据筛选方法
- ATLAS:在一小时内自动化近似 Transformer 以实现高效同态推理
- 频率至关重要:用于剪枝与量化的快速模型无关数据筛选
- GAMMA:面向任意预算的混合精度模型全局位分配框架
- KV缓存淘汰的概率解释
- CoFrGeNet:面向语言生成的连分数架构
- 压缩驾驶策略中能力损失与恢复的闭环评估
- 一个Token抵一千个:通过低 rank 克隆实现高效知识蒸馏
- Qwen3-4B 后训练三值化:能力、有效比特预算、存储压缩与部署
- 可扩展的克罗内克-费雪近似:针对十亿参数语言模型压缩的高效黑塞矩阵分析
- 在细粒度混合专家模型中免训练将激活专家减半
- 面向视觉与语言Transformer的感知损伤多臂老虎机剪枝技术
- 全为了1比特:迈向大语言模型真正的1比特训练后量化
- 高效注意力机制的线性代数基础:SVD压缩下秩坍缩的相位反转
- ECOKV:通过互补多样性度量实现几何感知的 KV 缓存淘汰
- 超全训练,紧凑部署:扩展结构化大语言模型剪枝的恢复能力
- REAL-Q:基于动态梯度下降的端到端大语言模型量化
- 突破 1.58 比特极限:三值大语言模型的极致压缩与加速
- PrismML 发布三值大模型 Ternary Bonsai 2 27B:仅 5.9GB 体积保留 98.2% 顶尖性能
模型去偏
模型去学习
模型反馈
模型发现
模型可解释性
- 短上下文语言建模中的逐层位置偏差
- 反事实模拟训练:提升思维链的忠实度
- 探究自动驾驶轻量级视觉语言模型中的视觉概念探测
- 大规模解释语言模型隐藏状态
- 汇聚而非准入:注意力机制如何将潜在变量转化为可表述形式
- 超越推理轨迹:将可解释的推理状态读出模块与原生 MoE 路由进行耦合
- 探究预填充阶段:通过潜在激活检测代码漏洞
- 上游决策,滞后执行:定位并评估多语言混合专家模型(MoE)的跨语言拒绝回路
- 言语过度自信的不同面相:一项可解释性研究
- 语言模型中的评估意识:表征、言语化与控制
- 通用语假设:大语言模型通过潜在的、与任务无关的特征空间进行翻译
- 通过 Transformer 变分自编码器学习稀疏决策树
- 通过卢卡谢维奇逻辑完全识别深层ReLU网络
- 并非所有大语言模型的推理过程都可见于思维链中
- LLM 如何遵循指令:多项语言技能的熟练协调,而非通用机制
- 大语言模型中的知识归因探测研究
模型可靠性
模型合并
模型同步
模型坍塌
模型基准测试
模型多样性
模型失效
模型委派
模型安全
- 作为攻击目标与对抗者的扩散大语言模型:机理性安全漏洞
- CASA:基于安全注意力增强分类的鲁棒多模态对齐
- GRM:通过梯度比率掩码对音频大模型实施兼顾效用的越狱攻击
- 多模态大语言模型不断演进的安全格局:新兴威胁与防御综述
- 预测性记忆定位:从内部信号预测选择性干预路径
- 工具返回结果比纯文本更具权威性吗?基于 Claude Opus 5 针对合成赋值任务中虚假声明采纳的三项前瞻性研究
- 通过拒绝别名缓解消融攻击 (Abliteration Mitigation via Refusal Aliases)
- 科学声明能从大语言模型中移除吗?声明级遗忘的系统性评估
- CLEAR:用于保持模型效用的连续潜在适配器路由大模型安全对齐
- RefusalGuard:大语言模型中保持几何结构的安全性微调方法
- 衡量大语言模型中的激活控制能力
- BLADE:大语言模型遗忘的双层低秩增广拉格朗日擦除方法
- Quasar:专为大模型代码操作而设计的编程语言
- LoRA 作为预言机:基于低秩适配器的神经网络隐蔽后门审计与消除
- 大语言模型中的量化触发式后门:跨量化器可迁移性与验证-部署鸿沟
- 从检测到拒绝:通过电路引导的权重缩放构建更安全的大语言模型
- 通过激活匹配微调检测大语言模型中的隐藏行为
- 表征对齐带来语言模型中具泛化能力的安全性
- 解码前拒绝:检测与利用大语言模型中间激活中的拒绝信号
- 迁移安全意识:多模态大语言模型中的跨模态安全漂移
模型安全性
- 视觉语言模型中基于方向的推理时防御机制的跨架构审计
- 正确的诊断,装饰性的推理:医疗思维链的扰动审计
- 潜诊断分类法:构建分类器及诊断其决策的框架及其在提示词注入检测中的应用
- 坦白你所知:大语言模型遗忘中“遗忘集与模型知识错位”问题研究
模型审计
- 基于物理基础的端到端驾驶规划器因果审计
- Why2Speak:拒绝行动策略的忠实推理
- 打破假设:针对语义攻击对输入侧越狱防御机制的审计
- 掩码并非模型:对注意力、状态空间及混合序列模型中前缀不变性的审计
- 自信且错,悄无声息:端侧部署语言模型未遂故障审计
- 自信地出错且悄无声息:对已部署端侧语言模型不可检测故障的审计
- 超越端点收益:医疗专业化模型的权重差分审计
- “无瑕”之心铭记什么:知识纠缠如何塑造大模型遗忘后的信息泄露
模型对齐
- 观点:是时候优化大语言模型的自洽性了
- 可信智能体网络:智能体网络中的信任必须是原生构建的,而非事后补救
- REIN:通过反思与弃权对齐弥合推理与可靠性之间的鸿沟
- 不匹配至关重要:超越Token一致性的在线蒸馏技术
- 基于《成人类卡牌游戏》(Cards Against Humanity) 的跨模型幽默偏好建模
- 智能体安全性应当是一项运行时契约
- 死文本还是约束条款?衡量与恢复黑盒大模型对话中的约束影响力
- 不求甚解的盲目模仿:大语言模型中决策偏差的根源
- 状态条件验证:用于适配与监控安全分类器的正确性估计
- 自动还是受控?重复启动效应揭示了基础大模型、指令大模型与人类的思维处理分化
- 语言模型微调中的幽灵相变:密度矩阵分析
- 通过注意力头干预实现大语言模型中的个性化隐私控制
- 隐藏在请求之中:通过词元相关性解释不道德的大模型依从现象
- 智能体脚手架会放大大型语言模型的谄媚行为
- 大规模语言模型中通过偏好数据筛选减轻对齐税
- 单个神经元何时能修复大语言模型中的重复循环?
- REINS:基于稀疏自编码器特征的拒绝增强抑制性调控
- 安全性的不稳定性:随机种子与温度如何暴露出大模型不一致的拒绝行为
- 当安全路由失效:解析良性微调下的对齐脆弱性
- 大语言模型中的“拆屋效应”请求与拒绝行为
- 人类心理测量问卷错误表征了大语言模型的行为
- 续写与拒绝的博弈:大语言模型中续写触发型越狱的机制分析
- 量化放大确定性而非偏见:服务时权重压缩的尺度依赖行为效应
- 你无法偏好未曾采样的情感:DPO微调大语言模型中的强度不足现象
模型小型化
模型层析成像
模型崩塌
模型崩溃
模型干预
模型并行
模型幻觉
- 迈向基于查询覆盖率与声明可验证性的查询无关型 RAG 评估
- 已知而言:通过召回锚定蒸馏防止大语言模型监督微调中的事实访问失效
- 门控激活引导:减少医学问答中的谄媚现象与幻觉
- 大型视觉语言模型中用于缓解幻觉的动态对齐补偿方法
- 关系线性度是大模型幻觉的预测指标
- 通过幻觉空间投影减少 Whisper 模型中的幻觉转录
- 保护性能力幻觉:当大语言模型声称拥有不存在的能力
模型强化学习
模型归因
模型微调
- 使用 NVIDIA NeMo AutoModel 加速 Transformer 微调
- MathShikkha:针对孟加拉语数学推理的小型语言模型中“仅答案”与“思维链”监督的对照研究
- 我们能否优化性能与碳排放的盈亏平衡点?探索更绿色的大语言模型
- 从通用走向专业:利用冻结视觉语言模型实现内窥镜息肉报告的上下文融合框架
- RefusalGuard:大语言模型中保持几何结构的安全性微调方法
- 超越视觉所见:揭示多模态大语言模型的情境错觉
- 特定领域大型语言模型在回答精神病学患者咨询中的表现
- 模型之模型:何时输出专家模型能胜过注意力机制、自适应或微调?
- 压缩三位一体:探索大语言模型压缩的稀疏性、量化与低秩近似
- Diff Mining:通过Logit差异揭示微调目标
- 超越端点收益:医疗专业化模型的权重差分审计
- 先实现可玩,再追求优秀:面向小型对话游戏智能体的分阶段交互学习方法
- WHALE:联合优化框架与模型权重的简单方法
- 为什么微调会加剧幻觉以及如何解决
- 通过 100 步 GRPO 微调 350M 模型以获得更好的结构化输出
- HEAT:通过近似与权重协同适配实现更快速的全同态推理
- TaRA:感知训练过程的低阶适应初始化方法
- 超越迁移准确率:面向低资源语言的机制引导受控自适应
- 通过训练编译:将自然语言规范转化为本地神经函数
- 当金融微调失效:领域适应大模型中数字幻觉的三级可检测性分析
- 路由器先验偏置:在 MoE 后训练中保持基础路由结构
模型忠实度
模型性能
模型扩展
模型扫描器
模型拒绝机制
模型探测
模型控制
模型推理
- MACRO:Transformer 层的马尔可夫链路由
- vLLM V0 到 V1 迁移:在强化学习中纠正偏差前,先确保后端正确性
- APEX:面向内存高效的边缘端 MoE 推理的自适应专家预取技术
- 基于自适应注意力匹配的推理过程思维感知 KV 缓存压缩
- KV-Rescue:通过逐步交织恢复推理语言模型的KV缓存淘汰损失
- S2-MoE:在边缘设备上实现高效的混合专家模型自推测解码
- 编码智能体是否需要可执行世界模型、简化和验证来解决 ARC-AGI-3?
- Perplexity开源Lily:专为Apple Silicon上Qwen3.6-35B-A3B打造的Rust + Metal推理引擎
- HEAT:通过近似与权重协同适配实现更快速的全同态推理
- 是问题本身,而非路径:大模型推理轨迹中的预算与难度混淆
- 别放弃Dropout:优化层稀疏性以实现高效的LLM训练与推理
- 动态路由器需要记忆吗?HeRo:面向高效大模型推理的历史感知路由机制
模型推理优化
- 注意力头的自主性:利用冻结的查询-键几何实现免数据的稀疏注意力机制
- GraniKV:针对具有长共享前缀的多智能体系统的非对称粒度KV缓存分页
- Sigmoid Attention:构建学习型 KV 缓存淘汰的更优底层架构
- ST-Lite:面向长程 GUI 智能体的免训练空间轨迹引导 KV Cache 压缩框架
模型推理加速
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- CORA-Diff:面向高效扩散语言模型推理的置信度导向残差接受机制
- ACE:基于MoE的大语言模型自适应免校准专家跳过技术
模型提取
模型提取攻击
模型收敛
模型效率
- 学习预测 MLLM 中的中间层注意力以实现视觉 Token 剪枝
- 思维漏斗:通过早期投票与推演剪枝实现高效的测试时缩放
- CAI-DLLM:扩散语言模型的收敛感知推理
- SABER:基于对抗分支探测的大语言模型推理稳定性感知早退机制
模型整合
模型更新
模型架构
- HELIX:面向递归自我提升的模型与运行壳协同演化
- 基于目标侧阅读器适配的跨模型记忆迁移
- GLM-5.3-Flash 对比 Qwen3.8-Flash-Next:两家中国 AI 实验室如何独立收敛于相同的模型架构
- 更具表达力的前馈层:第一部分. 激活函数的Token自适应混合
- 逻辑门网络的深度可扩展性研究
- 揭示大语言模型中类人表征的计算要素
模型校准
模型欺骗
模型比较
模型水印
模型泛化
模型溯源
模型漂移
模型版本更新
模型生成能力
模型监控
模型稀疏化
模型稳定性
模型组合
模型缓解
模型编译
模型编辑
- 通过拒绝别名缓解消融攻击 (Abliteration Mitigation via Refusal Aliases)
- 单个神经元何时能修复大语言模型中的重复循环?
- 能力门控语言模型:安全性具备组合性,而效用则不然
- 通过基于SAE的引导解决知识冲突的关键路径识别
- 引君入瓮与恢复:通过投毒内部拒绝信号防御白盒编辑越狱
模型缩放
模型蒸馏
- 啄木鸟蒸馏:弱模型诊断强模型中的推理缺陷
- WAM-Diff2:用于高效率自动驾驶VLA的分层自回归到扩散蒸馏
- 长 SKILL 合规性作为逻辑推理:基于闭包扎根检测与缩放引导的策略内蒸馏
- 广度推理而非深度推理:将推理溢价摊销为蒸馏技能
- RL原生蒸馏:利用评分轨迹实现少步图像生成
- CForce:通过一致性强迫提升扩散大语言模型的并行解码能力
模型融合
模型行为
模型解析
模型解释
模型解释性
模型训练
- 优化器状态究竟该存放在哪里?面向内存高效的混合专家模型训练的分层状态分配
- 通过跨难度优化动力学理解大语言模型中的课程学习
- ERASE:用于现代推荐系统加速训练的早期反向传播调度方案
- 训练 nGPT
- 别放弃Dropout:优化层稀疏性以实现高效的LLM训练与推理
- 更少数据、更快训练:重复较小数据集通过采样偏差加速学习
模型评估
- OrchestraBench:评估多智能体编排的失效模式、恢复能力与任务拆解质量
- 衡量与检测有害的AI谄媚行为
- 基准测试的基准:评估对话智能体评测集
- 零差距不等同于恢复:基准测试污染的分层逐题概率评估与逐步缓解策略
- 追求 SOTA:时间序列预测必须采用分类特定的评估方法以消除虚假增益
- 小米 MiLM Plus 发布 PROVE:面向感知对齐的对象移除评估指标
- 单周期智能体自归纳下AI护栏的生存状况
- 措辞效应:量化大语言模型基准测试中的双向漂移
- 迈向可持续的人工智能:深度学习模型碳足迹的综合综述与比较分析
- 这是你的最终答案吗?跨语境一致性作为大语言模型可信度的度量标准
- QuoteBench:匹配分数如何掩盖命令路径失效
- LOB-ID:通过初始距离评估合成市场数据
- AI聊天机器人中的广告?大语言模型如何应对利益冲突分析
- 通过在线自蒸馏缓解大模型评判中的评分标准干扰
- 人类评估中的真实性鸿沟
- 衡量依赖鸿沟:诊断表格生成模型中的列间保真度
- 衡量语音识别中的基准过拟合现象
- 病理基础模型的分布鲁棒性边界
- ClawProBench:AI 代理的轨迹感知评估
- 语言模型中的评估意识:表征、言语化与控制
- 针对未见问题的LLM评估:上下文多维项目反应理论模型
- 多语言大语言模型裁判中的排名反转现象:一种无标签的双中心化校准器
- 超越基准:基于拟人化与生命周期导向的大模型评估路线图
- 裁判应当知道发生了什么变化:大模型作为裁判评估的构念效度
- FraudBench:金融风险评估中对抗鲁棒性的协议敏感型基准测试
- 更智能的验证,更深度的进化:通过行为感知验证实现高效的智能体框架演进
- 并非所有的评估感知都生而平等:能力框架预示着合规性
- 为什么RAG会产生幻觉:引入“知识缺口金丝雀”的检索增强生成系统惩罚感知评估
- FlavourBench:用于大语言模型评估与后训练的可执行烹饪奖励地图
- 检索、打分与解码方式对基于大语言模型的对话式推荐系统性能与稳定性的影响
- LivingArena:大模型知道其他大模型不知道的吗?作为可扩展评估的同伴探测技术
- FLY-EVAL++:面向大语言模型安全约束飞行预测的证据驱动评估协议
- 清洁工程,不稳定测量:黑盒大语言模型观察者在共享端点上预注册的可靠性失效
- LightEMMA:视觉语言模型自动驾驶能力的纵向评估
模型评测
模型路由
模型轻量化
模型迁移
模型适配器
模型选择
模型透明度
模型通信
模型重现
模型量化
- BaKron:基于克罗内克因子化黑塞矩阵的高效量化
- openPangu模型在昇腾NPU上的量化实证研究
- 大型语言模型中的量化退化:信号与噪声的视角
- 推理型大语言模型中的隐藏语言一致性现象
- 目标感知的校准数据选择:在量化语言模型中保持不确定性
- 感知量化修复:恢复压缩版 4-bit 大语言模型的实用方法论
- 小型推理模型在函数调用中即为指令遵循者
- 大语言模型还能解释自己吗?量化对自解释影响的研究
- GAMMA:任意预算下混合精度模型的全局比特分配
- 使用超低比特量化模型拓展大语言模型推理的极限
- GAMMA:面向任意预算的混合精度模型全局位分配框架
- 大语言模型中的量化触发式后门:跨量化器可迁移性与验证-部署鸿沟
- 比 Flash 更快:利用注意力稀疏性实现高效的长文本解码
- QTEA:基于稀疏残差显著权重与按列优化的三值大语言模型
- 为什么门控DeltaNet能在4位量化下存活:混合27B大模型循环部分的NVFP4 W4A4技术解析
- 当量化破坏记忆:低精度时间序列推理中的循环状态回写机制
- 量化放大确定性而非偏见:服务时权重压缩的尺度依赖行为效应
- 准确率并非全部:基于散度的方法评估量化大语言模型的保真度损失
- REAL-Q:基于动态梯度下降的端到端大语言模型量化
- 突破 1.58 比特极限:三值大语言模型的极致压缩与加速
模型错进化
模型防御
模型预测控制
模型驱动强化学习
模型验证
模型鲁棒性
- AndroidReality:移动智能体距离现实世界还有多远?
- TestifAI:基于层析成像的深度学习系统测试方法
- 词汇扰动破坏大模型推理:注意力转移的实证研究
- ADVERSA:衡量大语言模型中多轮护栏退化与判别器可靠性
- 无梯度自适应:仿射统计迁移及其证书的启示
- 重形式轻实质:内容不变的外壳如何颠覆大模型安全评判器的裁决
- 大语言模型是否在“自食其言”:多轮交互中的因果历史效应
模式接地
模式补全
模式识别
模态大语言模型
模态崩溃
模态消融
模态转换
模拟人生
模拟仪表
模拟器
模拟器基座
模拟电子
模拟电路
模拟电路设计
模拟随机对照试验
模拟集成电路
模板注入
模糊推理
模糊测试
- 智能体自主研究即模糊测试 (arXiv:2608.09855 [cs.AI])
- FuzzingBrain-Bench V1:评估大语言模型的开放式漏洞发现能力
- 如何精准捕获代码缺陷:基于 Rust 正则引擎的高效模糊测试实战
模糊逻辑
模组化架构
模运算
次模最大化
欧拉控制
欺骗性机制
欺骗机制
欺骗检测
正则化
- 锚定正则化直接最小二乘法(ARDLS):整合既有优先级算子以实现层次分析法中的权重提取
- 正则化在平均化后能保留多少?联邦学习中的更新掩码机制
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越正则化方法
- 面向持续知识图谱嵌入中候选集干扰的匹配超额超越者正则化
正则表达式
正则表达式合成
正电子发射断层扫描
步态分析
步骤级推理
残差建模
残差连接
比例代表性
比例类比
比特翻转攻击
气候模拟
气象学
气象数据
气象预测
水下感知
水下机器视觉
水印技术
水库计算
污水处理
污点分析
汽车工程
汽车电子
汽车诊断
河内塔
治理执行
法律AI
法律大模型
泛函分析
泛化与记忆
泛化理论
泛化界
泛化能力
- 具备自主决策能力的自动显微镜基准测试:支持系统资质认证,但未必能泛化至未见任务
- 学习不该学的内容:用于鲁棒视觉-语言模型的对抗解耦提示微调
- 动态上下文调度:超越静态宇宙的学习
- AgentMercury:让你的智能体在大规模业务场景中自主合成可验证环境
- 通过算法与超参数的SHAP分析增强机器人强化学习的泛化能力
- 锁定的评估表面:CRISPRi 扰动效应预测中的迁移失败与采样深度纠缠
泛化鲁棒性
波兰语基准
波束赋形
注意力头
注意力头干预
注意力机制
- GAUGE:面向不完整多模态分类的粒度自适应反事实证据门控
- 矩阵带状注意力机制:Set Transformer 的上下文自适应值投影
- 学习预测 MLLM 中的中间层注意力以实现视觉 Token 剪枝
- 权重空间消融下的跨层交互:闭式注意力雅可比边界与真实预训练模型测试
- 抛弃锚点:通过 Pulsar Attention 实现分布式系统的统计上下文摘要
- 线性化二维单纯形注意力机制
- 谱奇异值揭示了Transformer注意力机制中占主导地位的学习结构
- Riemann GeoResolver:从欧几里得解析器到双曲-球面几何的非欧几里得注意力框架
- 你的 KV 缓存不是比特问题,而是几何问题
- 基于自适应注意力匹配的推理过程思维感知 KV 缓存压缩
- 公式之前的架构:超越组合图谱的神经网络架构个体化
- SAGE:基于注意力引导熵的脉冲Transformer替代梯度自适应方法
- 汇聚而非准入:注意力机制如何将潜在变量转化为可表述形式
- 当熵不再足够:在大模型输出长度预测中找回丢失的语义
- Wiola 13M:面向参数高效小型语言模型的门控螺旋注意力架构
- 你的注意力指标究竟在回答哪个问题?作为成分数据的注意力行
- 分数衰减 KV 缓存:面向对话系统推理相关性优化的所有权感知内存管理
- 从注意力掩码到惯性零向量标记:OAttention 与 O-Closure 标记动力学
- 临床长文本推理的抑制性注意力机制:电子健康档案处理中迷失在中间效应的表征与缓解
- 模型之模型:何时输出专家模型能胜过注意力机制、自适应或微调?
- 读、写与松弛:为什么神经偏微分方程代理模型需要同时具备全局与局部处理能力
- 词汇扰动破坏大模型推理:注意力转移的实证研究
- 掩码并非模型:对注意力、状态空间及混合序列模型中前缀不变性的审计
- 遗忘不等于简单擦除:基于生成不等式的时序解耦
- LoRA微调过程中公理化注意力模式带来的相关性涌现
- LOCKS:用于高效长文本解码的页局紧凑键摘要
- 掩码并非模型:审查注意力机制、状态空间及混合序列模型中的前缀不变性
- 注意力作为条件反射:经典学习理论对线性Transformer的预测
- 比 Flash 更快:利用注意力稀疏性实现高效的长文本解码
- 表征干涉的驱动力是什么?关于干涉模型拒绝机制的机制性案例研究
- 给它空间!编码器中位置与语义表示的显式解耦
- 音视频模型中的注意力三角形
- mHC 如何使用其残差流:选择性路由与近恒等混合
- 大型视觉语言模型中涌现的目标导向注意力
- 高效注意力机制的线性代数基础:SVD压缩下秩坍缩的相位反转
- ECOKV:通过互补多样性度量实现几何感知的 KV 缓存淘汰
- CodeTD:注意力拓扑结构检测代码大语言模型中的幻觉
- HISA:面向细粒度稀疏注意力的高效分层索引机制
注意力机制优化
泰米尔语
泰语
流体与工程仿真
流体力学
流体控制
流体模拟
流匹配
- LC-GRPO:通过朗之万修正弥合基于流的 GRPO 训练与推理差距
- 流匹配不确定性的几何学:零成本不确定性代理及其在基于流的VLA故障检测中的应用
- FUSE:面向混合类型表格流匹配的跨列交换特征级统一专业化方法
- 衡量依赖鸿沟:诊断表格生成模型中的列间保真度
- ConvergeFlow:具备可证明收敛到词元嵌入能力的语言流模型
- 物理引导的流匹配用于CT图像重建
- 条件流匹配何时可以替代逐点负对数似然?
- 匿名化而非消除:保留实用性的语音匿名化
流式处理
流式推理
流式推理模型
流式算法
流形学习
流模型
流水线并行
流畅度陷阱
流量管理
测试准确率
测试平台生成
测试时恢复
测试时扩展
测试时搜索
测试时缩放
测试时自蒸馏
测试时自适应
测试时计算
测试时训练
测试时适应
测试期计算
测试用例合成
测量技术
测量预算
浏览器
浏览器AI
浏览器智能体
浏览器端AI
浏览器缓存
浓度不等式
浮点数
浮点数精度
浮点数误差
海上监控
海事信息
海事信息交换模型
海事导航
海岸动力学
海洋预报
海马体
消息传递
消融攻击
消费级硬件
涌现行为
深度Q网络
深度伪造检测
深度学习
- Otter:一款具备时间感知与历史上下文的人类国际象棋 AI
- ECG-LENS:融合导联感知与临床上下文的心电图报告生成与评估
- TS-RAG:用于时间序列预测的检索增强生成
- SafeDivertor:通过利用时频先验从宏观等离子体状态信号中高保真重建偏滤器热通量
- UniVVT:用于高保真视频虚拟试穿的统一端到端框架
- 超越序列顺序:Transformer 的句法感知位置编码
- 矩阵带状注意力机制:Set Transformer 的上下文自适应值投影
- λSplit:用于荧光显微成像的自监督内容感知光谱解混模型
- vLLM 原生速度 Transformers 模型后端
- PyTorch 性能剖析(第一篇):
torch.profiler新手入门指南 - 您自己本来也想提的 Pull Request:用代码智能体加速 MLX 语言模型移植
- 仅需 165 美元,跨越 25 个物种训练 mRNA 语言模型
- bioMoR:用于高效基因组学习的生物学引导递归混合模型
- Fast LapSum:百万级规模下的精确可微 Top-k 算子
- PTQ4SNN:面向脉冲神经网络的膜电位感知后训练量化技术
- Muon 训练 Transformer 中的表征-读出接口后突悟崩塌现象
- QFCQT:用于高波动性时间序列预测的混沌门控量化变压器框架
- ReLU 网络中隐藏规范对特征专业化的控制
- FUSE:面向混合类型表格流匹配的跨列交换特征级统一专业化方法
- 使用深度学习图像分割和几何建模从零回波时间 MRI 中自动提取的测量结果与专家手工读数高度一致
- Fluid-DiT:用于流体流动模拟学习的无图扩散Transformer
- 追求 SOTA:时间序列预测必须采用分类特定的评估方法以消除虚假增益
- SignVerse-2M:一个包含 55 种以上手语、拥有两百万剪辑的姿态原生宇宙
- 迈向双塔推荐模型的理论理解
- 通过多通道光谱精细化与Savitzky-Golay平滑优化基于MXene超表面的光谱预测
- 跨资源区间的依存句法分析:评估高资源与低资源语言上的架构性能
- 表面公平?大语言模型推荐系统中隐藏输出公平性差距的基准测试
- CoRCi:跨域序列推荐中相干兴趣的交叉重构建模
- 二阶 Muon 优化算法的正确实现:谱几何与曲率的原则性结合
- LGNNIC:利用智能网卡(SmartNIC)加速大规模图神经网络(GNN)训练
- 基于多任务一致性的对抗攻击检测
- 基于敏感度建模的开放世界语义分割
- CORA-Diff:面向高效扩散语言模型推理的置信度导向残差接受机制
- 面向高光谱鱼类新鲜度分类的域感知轻量级光谱分组卷积
- 迈向可持续的人工智能:深度学习模型碳足迹的综合综述与比较分析
- sLTN:结构化逻辑张量网络
- MRIComp4Flow:用于训练多模态生成模型的 3D 脑部 MRI 压缩
- 扰动响应中证据、矛盾与脆弱性的分解
- 科学数据高保真学习压缩的残差建模
- 优化器状态究竟该存放在哪里?面向内存高效的混合专家模型训练的分层状态分配
- 通过感知I/O重构实现快速且内存高效的小波卷积
- 通过XAI驱动的数据归约实现时间序列分类的规模化扩展
- The Architect:在 Microsoft Excel 中交互式可视化深度学习数学原理
- 时间序列基础模型中的预测崩溃现象
- LP-NAS:基于线性规划的神经架构搜索
- 面向大规模与高阶MIMO检测的“学习转换”(Learning-to-Transition)框架
- 纠正你所看不见的错误:多模态推理机中感知蒸馏的归因问题
- OTIS:使用微型编码器学习高质量时间序列特征
- 重新定义视觉领域的泛化能力:基于 FusionDetect 的双轴虚假图像检测框架
- 用树结构打破链条:具有 \(mathcal{O}(log N)\) 时间复杂度的模型并行深度学习
- 迈向医学影像无监督域适应的实用算法选择
- 无需求解器的可解推箱子(Sokoban)生成:基于扩散模型的方法
- 蛋白质结构预测:从进化约束到生成式建模
- 使用3D生成式AI从基线MRI合成烟雾病术后乙酰唑胺脑血流图
- 面向超高分辨率遥感图像分割的分层自适应特征精炼网络
- 利用图神经网络表征心脏组织特性
- CM-MAE:面向视觉-无线应用物理机理引导的跨模态自监督学习框架
- 肺癌组织病理学深度学习架构的综合基准测试
- RetroMPA:用于增强逆合成预测的分子属性感知辅助框架
- OceanLight:基于几何自适应非结构网格表示的高效全球海洋预报
- AsyTO:用于参数高效的多变量时间序列预测的不对称时间算子
- 图机器学习:电力系统的新机遇
- 面向CSI反馈的Learnware:场景专用小模型如何发挥巨大作用
- 利用幅度与复数测量结合学习先验提升动态磁共振成像重建性能
- FUSE:基于面部视频的帧统一应激估计
- ERASE:用于现代推荐系统加速训练的早期反向传播调度方案
- 遗忘、可塑性与协同观测:持续学习的第三维度
- GCNO:用于无线信道物理压缩的格拉姆切比雪夫神经算子
- 学习状态感知的面向小规模数据集动态生成式数据增强
- RULER:机器遗忘的表征级验证
- DELOS:用于Kepler光变曲线低信噪比盲搜的对比深度学习方法
- 从注意力掩码到惯性零向量标记:OAttention 与 O-Closure 标记动力学
- 解剖学先验信息神经网络:在损失函数与网络架构中编码解剖学先验,并结合SE(3)公式建立导丝诱导的腹主动脉髂动脉变形模型
- 利用空间望远镜数据与生成式AI增强数字巡天的成像能力
- HIERA:针对GPU内核优化的跨实现空间工作负载感知规划
- TurboBias 2.0:面向生产级高效 ASR 系统的流式上下文偏置框架
- MEMONDEMAND:面向大规模企业数据的内存管理系统
- RoboShape:面向隐私感知机器人感知的基于信息论的点云表征
- 构建用于基于人工智能的连续环形撕囊术技能迁移的预测性手术路径
- 用于实时托卡马克平衡预测的AI代理模型:神经网络架构基准测试与EXL-50U验证
- Nova:面向深度学习的端到端 MLIR 编译器
- 基于分层语言模型的动态多字节预测
- 从梯度提升树到深度推荐器:生产环境客服推荐系统迁移的实战经验
- ExPhy:多物体轨迹预测中显式物理属性学习的基准测试
- 迈向预测性流程挖掘的可复现性:SPICE —— 一个深度学习库
- 离散扩散模型:从分词到生成的统一框架
- 基于预训练特征、数据增强与全新 SheetSage-A2S 数据集的音频转乐谱系统
- AI新方法揭示基因组模型从DNA中学习的内容并暴露出隐藏的实验偏差
- 句法与语义:Transformer如何学习深层依赖
- PailitaoGR:生成式图像检索的潜在图像思考框架
- 图像分类神经网络中,权重高的神经元一定重要吗?
- 扩散模型原理
- 逻辑门网络的深度可扩展性研究
- 基于输出重要性的残差稀疏化:用于压缩专家混合大语言模型
- 预测编码网络中隐藏状态优化顺序的研究
- TimeSteer:联合视听扩散模型中的推理时语音调度
- Transformer的拓扑困境
- 从特征交互到特征传输:可扩展推荐模型的统一构建模块
- RecKAN:具有可学习递归多项式基的柯尔莫哥洛夫-阿诺德网络
- 优化中的渗透动力学:方差级联与离散尺度不变性
- 稀疏混合专家模型中共享路由几何结构与动态的证据
- TaRA:感知训练过程的低阶适应初始化方法
- 联合嵌入预测世界模型在物理规划中取得成功的关键驱动因素是什么?
- Nova:面向深度学习的端到端 MLIR 编译器
- 自监督视觉表示学习的三个必要原则
- 训练 nGPT
- 结合视觉先验的医学病灶分割特征重构方法
- CauseCollab:用于异构协同感知的因果统一与模态无关网络
- TraveL:基于Transformer的多视角路径分布表示学习
- 合成数据能将泰语 OCR 推向多远?
- 数值数据可解释异常检测的可微区间瓶颈
- 挤出长丝形状对3D混凝土打印可打印性的影响:基于几何信息的深度学习-有限元方法
- 通过卢卡谢维奇逻辑完全识别深层ReLU网络
- SV-Detect:利用引导向量进行AI生成文本检测
- IPGeoAI:基于Transformer与大语言模型语义融合的IP地理定位技术
- CHAMP:在线多人游戏中用于配对与预测的跨域混合架构
- 别放弃Dropout:优化层稀疏性以实现高效的LLM训练与推理
- 超越同购关系:Allegro互补推荐系统的演进
- 追踪音频大语言模型中的音频基础与答案选择机制
- 更少数据、更快训练:重复较小数据集通过采样偏差加速学习
- DeepAffinity:利用小型语言模型预测电子商务中的长期商品属性偏好
- 价格与交易动态的可解释深度学习:从黑箱预测到高效参数化模型
- 扩展 Raschka 的 GPT-2:在 RTX 3090 上从头训练专家混合(MoE)模型
- 基于循环流的思考:通过动态计算分配提升深度推理能力
- 连续扩散语言模型在规模化扩展上可媲美离散扩散
深度学习优化
- 让知识蒸馏成本大幅降低以实现规模化运行
- LoCA:基于局部信用分配与单次校准的大模型前向微调方法
- EasyBalance:分布式 MoE 推理中的跨层负载均衡
- SDS-LoRA:克服低秩适应中的各向异性梯度缩放
深度学习优化器
深度学习安全
深度学习推理
深度学习测试
深度学习理论
- Riemann GeoResolver:从欧几里得解析器到双曲-球面几何的非欧几里得注意力框架
- 稀疏原型代码构成了跨模态分类与预测的基础
- 一维二次曲面上 Adam 优化器稳定性边缘(Edge-of-Stability)的可证明性
- 为什么鲁棒性会减少叠加?
深度学习硬件
深度学习编译
深度层级
深度展开
深度引导
深度强化学习
- 利用深度强化学习解决车辆路径问题:工业卡车规划案例研究
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习
- 放置、切片与调度:系留毫米波无人机基站的分层 O-RAN 控制
- 在Atari Pong中改进强大智能体背后的弱世界模型
深度循环
深度感知
深度搜索
深度研究
深度研究智能体
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- 不值得再消耗一个Token:面向高效深度研究智能体的边际价值估计
- OpenResearcher:用于长程深度研究智能体轨迹合成的完全开源框架
深度神经网络
深度算子网络
深度防御
深度集成学习
混合专家模型
- 上游决策,滞后写入:定位与评估多语言 MoE 的跨语言拒绝电路
- 轻量级微调下的路由器敏感性识别混合专家模型中的可剪枝专家
- EasyBalance:分布式 MoE 推理中的跨层负载均衡
- APEX:面向内存高效的边缘端 MoE 推理的自适应专家预取技术
- 双流Transformer:将主预填充路径与额外的解码计算解耦
- TEMPO:跨内存和计算瓶颈区感知完工时间的专家并行负载均衡
- 优化器状态究竟该存放在哪里?面向内存高效的混合专家模型训练的分层状态分配
- MoE 路由引导的异构联邦指令微调聚类方法
- 混合专家(MoE)模块包含强有力的幻觉检测信号
- 上游决策,滞后执行:定位并评估多语言混合专家模型(MoE)的跨语言拒绝回路
- Palmyra x6 技术报告:基于锚定监督微调的智能体与工具调用模型
- S2-MoE:在边缘设备上实现高效的混合专家模型自推测解码
- DF-MoE:基于多模态稀疏混合专家的通用深度伪造检测
- WiSDoM:面向多任务移动网络优化的基于混合专家模型的无线稀疏决策Transformer
- Xiaomi-TabLDM:表格基础模型技术报告
- T1:面向长程终端任务的强化学习智能体
混合序列模型
混合搜索
混合效应回归
混合整数规划
混合架构
- 大规模供应链运营中可靠的大模型驱动决策引擎:架构、安全与性能保证
- 大规模供应链运营中可靠的LLM驱动决策引擎:架构、安全性与性能保证
- HeadWiseKV:混合长上下文语言模型的按头预算化缓存驻留机制
- 为什么门控DeltaNet能在4位量化下存活:混合27B大模型循环部分的NVFP4 W4A4技术解析
混合检索
混合模型
混合精度
混合预测
混沌动力学
混淆性
混精度计算
渐近行为
渗透测试
渗透理论
温度缩放
渲染优化
游戏AI
游戏历史
游戏安全
游戏解说
游戏配对
湖仓一体
源码分析
溯因推理
- 大语言模型无法实现科学认知的‘跨越’
- 当规范补全出错时:大语言模型中“跳跃”的形式化与度量
- 语言模型会遵循奥卡姆剃刀原理吗?归纳与溯因推理中的简约性评估
- PIE-APT:通过增量推理在时序动态知识图谱上进行 abductive 规划
溯源完整性
溯源密度
溯源归因
溯源排名
溯源机制
溯源验证
漏洞修复
漏洞关联
漏洞分析
- 当经验化为指令:自进化智能体技能系统中的轨迹投毒
- 并非真正的无障碍:Android辅助功能如何将移动端AI智能体暴露于间接提示词注入风险中
- 单周期智能体自归纳下AI护栏的生存状况
- 当大模型反编译工具“编译”更多却“保留”更少
- 无盒漏洞分析:仅凭元数据检测 MCP 服务器的间接提示词注入漏洞
漏洞发现
漏洞挖掘
漏洞检测
- 基于大语言模型的程序语义不等价博弈
- 探究预填充阶段:通过潜在激活检测代码漏洞
- ARQ:用于C/C++漏洞检测的智能体CodeQL查询优化框架
- 超越 F1 分数:评估 AI 模型安全扫描器的覆盖率与故障恢复能力
- 历史即检测器:端到端执行CVE补丁历史
- AI编程助手在安装前会进行安全检查吗?针对研究软件供应链中信任信号的预注册需求侧审计
漏洞注入
漏洞评估
漏洞防御
漏洞防护
漏洞防范
演化博弈论
演化搜索
演化算法
潜在变量
潜在对齐
潜在激活
潜在空间
潜在空间监测
潜在结构分析
潜在路由
潜空间
潜空间动态
潜空间干预
潜空间探针
潜空间锚定
激活修补
- 权重空间消融下的跨层交互:闭式注意力雅可比边界与真实预训练模型测试
- 大模型拒绝机制中的对称性破缺:答案释放比恢复拒绝更具局部性
- 表征干涉的驱动力是什么?关于干涉模型拒绝机制的机制性案例研究
- 思维链失效时,解法隐藏在隐状态中
激活函数
激活匹配微调
激活图表征
激活工程
激活干涉
激活干预
激活引导
- 预测性记忆定位:从内部信号预测选择性干预路径
- 预测性记忆定位:从内部信号预测选择性干预路径
- 激活引导的信号来源:激活引导中的激活源选择
- ObserverBench:测试用于干预和控制的机械解释估计器
- 多模态大语言模型内部视觉表示的因果探测
- 激活引导能否捕捉多维度的作者风格?
激活探测
激活接口
激活控制
激活操控
激活源选择
激活监控
激活相加
激活空间
火灾检测
灵巧手操作
灵巧操作
灾害响应
灾害评估
灾难性记忆
灾难性遗忘
- 何时复习:语言模型持续预训练的间隔重复机制
- 遗忘、可塑性与协同观测:持续学习的第三维度
- 已知而言:通过召回锚定蒸馏防止大语言模型监督微调中的事实访问失效
- 大规模语言模型中通过偏好数据筛选减轻对齐税
- 超越迁移准确率:面向低资源语言的机制引导受控自适应
- 当合成数据带来负面效应:大模型智能体技能检索中的灾难性遗忘研究
点云处理
烟雾病
热力学
热力学耦合
热管理
热红外图像
熵测量
熵约束
版图优化
版本控制
牛顿法
物体擦除
物流优化
物流配送
物理AI
物理不变量
物理世界AI
物理仿真
物理信息神经网络
- 偏微分方程基础模型的无监督自适应
- BenthicDINO:面向视角不变侧扫声呐表征的物理融合自蒸馏方法
- ER-KANs:面向数据稀缺科学机器学习的高效且鲁棒的柯尔莫哥洛夫-阿诺德网络
- 物理信息随机配置机:一种用于非线性微分方程的无反向传播快速训练神经网络
物理基础模型
物理学习
物理学方法
物理实验
物理层
物理展开
物理属性学习
物理建模
物理引擎
物理感知
物理感知设计
物理控制
物理推理
- 被动物体状态世界模型中运动学、接触及物体恒存场的事件条件诊断
- 自进化科学智能体设计具备物理推理能力的白盒流体控制
- PhysElite:大语言模型距离解决奥林匹克级物理题还有多远?
- PhysElite:大模型距离解决奥赛级物理题还有多远?
物理机制发现
物理模拟
物理模拟器
物理系统建模
物理约束
物理设计
物理越狱
物理驱动
物联网
特征专业化
特征交互
特征传输
特征反演攻击
特征叠加
特征学习
特征工程
特征提取
特征演化
特征精炼
特征缓存
特征解耦
特征选择
特征重构
特征非局域性
特殊函数
状态估计
状态回写
状态图
状态异常中和
状态抽象
状态持久化
状态收敛
状态汇聚
状态演化
状态演进
状态空间压缩
状态空间模型
- 点火指数:衡量语言模型中的全局工作空间动力学
- 你的概率式JEPA暗中其实是一个隐马尔可夫模型:联合嵌入预测学习的状态空间解释
- 掩码并非模型:对注意力、状态空间及混合序列模型中前缀不变性的审计
- 是一个电路,而非那个电路:Mamba-2 状态汇聚的非唯一因果定位
- 掩码并非模型:审查注意力机制、状态空间及混合序列模型中的前缀不变性
- 针对基于Mamba语言模型的隐藏状态投毒攻击
- 多层状态空间模型(SSM)的表达能力与局限性
- 高效注意力机制的线性代数基础:SVD压缩下秩坍缩的相位反转
状态管理
状态精确删除
状态记账
状态语义
状态追踪
状态预测解耦
独立集
玩家验证
环境合成
环境感知
环境探测
环境监测
环境科学
现实鸿沟
理论共鸣
理论分析
- 大语言模型中思维链推理的平均场动力学
- 迈向双塔推荐模型的理论理解
- 巩固世界的边缘:多智能体世界边界中的持续学习问题
- 条件流匹配何时可以替代逐点负对数似然?
- 自监督视觉表示学习的三个必要原则
- 一个向量能容纳多少思维?叠加推理的表征容量
理论机器学习
理论框架
理论物理
理论研究
理论计算机科学
瓶颈诊断
生产力工具
生产环境
生产环境轨迹
生产系统
生命周期推理
生命周期管理
生存分析
生成对抗网络
生成式AI
- 域门控潜在扩散:基于第一性原理验证的 HMX 级含能材料生成式逆向设计
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- TailBooster:用于极限值增强与操作有效性强制约束的双层生成式框架
- 使用3D生成式AI从基线MRI合成烟雾病术后乙酰唑胺脑血流图
- Foresight-England:新冠疫情期间用于医疗事件预测的国家级电子健康记录生成式AI模型开发
- 通过大模型引导的强化学习实现高效个性化AI导师
- 学生与AI交互中的提问类型分析:一项针对两项CS2任务的案例研究
- 扩散模型赋能更聪明的无人机:决策与建模
- 利用空间望远镜数据与生成式AI增强数字巡天的成像能力
- 具备权威性的AI:从应用层到硅片
- 模型坍塌与应对策略综述
- 面向条件式CMR合成的生成式基础模型元数据感知适应
- 离散扩散模型:从分词到生成的统一框架
- 扩散模型原理
- 从截断到承诺:均匀离散扩散模型中的持久上下文
- 超越“AI生成”:通过可视化溯源密度来缓解透明度惩罚
- 陷入疯狂的递归:当AI不断吞噬自己的输出
- 面向目标导向对话编排的可审计符号-RAG-生成式AI架构
生成式信息检索
生成式基础模型
生成式建模
生成式引擎优化
生成式推理
生成式推荐
生成式搜索
生成式数据增强
生成式智能体
生成式检索
生成式模型
- LC-GRPO:通过朗之万修正弥合基于流的 GRPO 训练与推理差距
- 深度活动模型:用于人类出行模式合成的生成式方法
- 立场:推理是一个基于规则的可学习过程
- LOB-ID:通过初始距离评估合成市场数据
- 生成式模型隐空间中隐含波动率曲面的无套利几何学
生成式模拟
生成式重排
生成模型
- 主动推断生成模型的重整化:基础、推导与验证
- MRIComp4Flow:用于训练多模态生成模型的 3D 脑部 MRI 压缩
- ELVAE:基于证据学习的变分自编码器用于不确定性感知的生成
- RARF:用于三维脑部 MRI 修复的区域感知纠正流模型
生物信息学
- bioMoR:用于高效基因组学习的生物学引导递归混合模型
- 虚拟细胞的人机协同因果知识注入
- 基于静态分析引导的智能体 AI 翻译:使 Rust 成为全栈生物信息学语言
- PertMind:通过细胞扰动数据强化学习激发大模型的涌现生物推理能力
- GenEx:通过密码子共现网络进行SARS-CoV-2变异株检测的基于图的表征范式
- AI新方法揭示基因组模型从DNA中学习的内容并暴露出隐藏的实验偏差
- 药物毒性预测中提示词工程的分析研究
生物医学错误信息
生物学性别
生物统计学
生理学世界模型
生理稳定性框架
用户体验
用户偏好预测
用户反馈
用户异议
用户意图推理
用户画像
用户行为日志
用户行为轨迹
甲烷检测
电力弹性
电力故障预测
电力系统
电商
电商搜索
电子健康档案
电子健康记录
电子占据
电子商务
- MACS:用于可靠对话式电商推荐的混合多智能体框架
- RouteCost:一种受生产实践启发的电商预购运费估算多阶段框架
- TRACE:基于多源证据溯源的代理式商品目录增强框架
- 面向超大规模电商的时序感知复购预测:多场景生鲜推荐的生存分析模型
- DeepAffinity:利用小型语言模型预测电子商务中的长期商品属性偏好
电子工程
电子排布
电子电路
电子病历
电子结构
电子设计自动化
电容倍增器
电网模型
电路理论
电路表示学习
畜牧业
疟疾
疼痛检测
病理基础模型
白盒优化
白盒探测
白盒攻击
皮尔斯推理三分法
皮肤癌检测
监督学习
监督微调
- G-ReAct:基于结构-状态协同演化的图引导深度搜索
- Palmyra x6 技术报告:基于锚定监督微调的智能体与工具调用模型
- 已知而言:通过召回锚定蒸馏防止大语言模型监督微调中的事实访问失效
- SWE-Prime:更少的轨迹,更优的性能
- 引导而非求解:为大型代码智能体训练小型评论员模型
- LDC:通过动态控制生成研究构想的学习框架
- 通过贝叶斯视角统一 ICL、SFT 与 KL 正则化强化学习
- 扩散语言模型中的原位指令遵循
监督机制
目录分类学
目标关联
目标导向
目标导向理论
目标构建
目标检测
目标计数
目标跟踪
直接偏好优化
直接语料库交互
相似度分析
相变
相场模拟
相稳定性
真值探测
真实性探针
真实生态分析
眼动追踪
着色器
矢量瓦片
矢量量化
知识-逻辑-对齐
知识保留
知识公地治理
知识共享
知识冲突
知识分类
知识发现
知识图谱
- 抽象事件因果规则:归纳与应用
- 从样例中学习形状:递归 SHACL 中形状学习的基础
- EviGraph:证据引导的自主科研智能体
- 填补鸿沟:用于统一多任务用户意图推理的双知识图谱框架
- 基于智能体混合自顶向下与自底向上方法的知识图谱生成
- 用于医疗数据协调的双重混合语义数据湖架构:结合人机协同验证与大模型驱动的元数据标注系统
- 长 SKILL 合规性作为逻辑推理:基于闭包扎根检测与缩放引导的策略内蒸馏
- PolicyKG:将机构政策转化为 SHACL 知识图谱的智能体 LLM 流水线
- 基于RAG的工业现场总线设备自动配置
- 先治而后连:生产级知识图谱中的身份与本体标记
- Moose:\(mathcal{EL}^{++}\) 中具备推理捷径感知能力的潜在概念学习
- 使用 GraphRAG 将网络威胁情报投入实战
- 从非结构化召回转向模式接地内存:通过迭代式、模式感知的提取实现可靠的AI内存
- 个性化自动研究:迈向真正的 AI 共同科学家
- 机器智能的构成先验:人工物理世界的合法性理论
- 基于推理的编译至可微分电路:实现基于OWL 2 DL的神经符号学习
- RDFdL:将 RDF 与微分动态逻辑相结合
- 迈向自动化研究:利用具有范畴结构的论文知识图谱挖掘可证伪的研究构想
- 真实软件历史中的时间有效性:基于GitHub修复消除代码助手记忆中的陈旧事实错误
- SchemaRouter:面向高效异构智能体 RAG 的字段感知工具路由
- HERO:用于长程智能体记忆的人类画像增强检索优化框架
- 漫步黑暗面:使用 DARKSIDE 进行逻辑增强生成与连贯性审计
- 当名称跨越文字:蒙古世界历史实体对齐的源头依据基准
- 知识图谱上的神经符号推理:基于查询视角的全景综述
- NL2SHACL-Bench:自然语言转SHACL翻译的基准测试套件
- FedV-KGQA:基于垂直划分知识图谱的多跳问答框架
- pro-team 在 LLMs4OL 2026 的表现:用于本体学习的检索增强生成与词汇约束过滤
- 放手让他们窃取:使用知识蜜罐拦截大语言模型提取攻击
- post-graph-rag:原生于 PostgreSQL 的图 RAG 引擎
- 自然语言输入、语义航迹表示与大模型推理:让海事信息交换模型变得可行
- C-Unseen:利用大模型推理检测动态时序知识图谱中的弱信号
- pro-team 参加 LLMs4OL 2026:基于检索增强生成与词汇受限过滤 本体学习方法
- 放任盗取:利用知识蜜罐诱捕大语言模型提取攻击
- 自然语言输入、语义轨迹表示与大模型推理:让海事信息交换模型变得易于实现
- 选择而非训练:基于大模型选择器的模块化实体消歧的优势
- ISO-RAG:用于检索增强生成等周噪声控制方法
- SSAKG 2.0:用于结构化关联序列记忆与基于上下文检索的开源软件包
- 结合知识图谱扩展、RRF融合与分块扎根评估的企业文档搜索混合检索增强生成技术
- 匹配器裁决:威胁报告知识图谱提取的可复现性审计
- PIE-APT:通过增量推理在时序动态知识图谱上进行 abductive 规划
- 从大型语言模型中直接构建消歧知识库
- 语义贝叶斯世界模型
- 你的智能体记忆能经受住模型升级的考验吗?记忆可移植性的对照研究
- 以具现化作为可迁移词表:使用原生图神经网络实现零样本链接预测
知识图谱嵌入
知识图谱推理
知识图谱补全
知识增强生成
知识存储
知识对齐
知识工作
知识库
- SkillCommit:通过行为验证的范围扩展实现智能体技能演进
- 训练知识库:面向智能体策展文档库的监督式结构学习
- MediSkill-Evo:基于过程约束的自进化技术实现有据可查的临床交互
- WikiSkill:将智能体经验编译为持久化知识以实现技能进化
- WikiSkill:将智能体经验编译为持久化知识以实现技能演进
- 科学智能体技能:面向研究智能体的程序化知识库
知识库构建
知识归因
知识推理
知识提取
知识检索
- FluctlightDB:面向 AI Agent 的数据内存模型
- HAM-RAG:面向结构保真交错生成的层级感知多模态RAG
- 基于目标侧阅读器适配的跨模型记忆迁移
- 语义压缩树:通过分层语义残差实现多分辨率知识检索
- mimeo:将公开专家文集编译为智能体技能并测试知识迁移
知识注入
知识生命周期
知识管理
知识系统化(SoK)
知识纠缠
知识编辑
知识缺口
知识蒸馏
- 让知识蒸馏成本大幅降低以实现规模化运行
- SLED:通过知识蒸馏实现可扩展的位置编码
- MEGA:基于智慧图谱的自进化智能体优化基础设施
- CForce:通过一致性强迫提升扩散大语言模型的并行解码能力
- 纠正你所看不见的错误:多模态推理机中感知蒸馏的归因问题
- 一种用于大模型教师蒸馏标注的可扩展流水线:工作窃取任务调度与内存感知 GPU 并发
- 深度思考对齐:用于视频推理的轨迹级潜在蒸馏
- rEDMRec:将大语言模型推理蒸馏为可编辑的推荐经验记忆
- SkillForge:面向特定项目问题解决的自我蒸馏智能体
- 已知而言:通过召回锚定蒸馏防止大语言模型监督微调中的事实访问失效
- 感知量化修复:恢复压缩版 4-bit 大语言模型的实用方法论
- 量化感知修复(QAH):一种超越全精度原型的压缩4比特模型
- 任务特定大语言模型蒸馏的缩放定律
- 基于可验证奖励的同策略蒸馏 (OPDVR)
- Eluna:用于自动化仓库运营的推理与任务执行智能体系统
- MIMO:通过单语目标实现多语言信息检索
- 压缩驾驶策略中能力损失与恢复的闭环评估
- 一个Token抵一千个:通过低 rank 克隆实现高效知识蒸馏
- 在线蒸馏相遇离线GRPO:训练紧凑型指令遵循重排器
- 蒸馏前先验证:面向在线蒸馏的提示级教师门控机制
- 顺序优于联合:探索策略内蒸馏与RLVR之间的相互作用
- 通过训练编译:将自然语言规范转化为本地神经函数
- 极度稀疏的监督信号即可激发大模型的推理能力
- 蒸馏视觉语言模型以实现端侧火灾理解
知识蜜罐
知识表征
知识表示
- 大语言模型的地理空间概念探测:抽象性、组合性与基础性
- 一阶证明搜索中保持结构的的不确定性传播
- HyperANFIS:通过双曲几何增强自适应神经模糊系统中的规则表示与可解释性
- sLTN:结构化逻辑张量网络
- 基于推理的汽车电子电气部件鲁棒性验证
知识迁移
知识遗忘
知识错位
矩阵乘法
矩阵倒置
矩阵几何
矩阵分解
矩阵奇异值分解
矩阵带状注意力
矩阵理论
矩阵病态性
矩阵秩
矩阵算子
矩阵论
矩阵运算
硬件DIY
硬件制作
硬件加速
- 在原生 FP4 硬件上使用 MXFP4 预训练大语言模型
- ERASE:用于现代推荐系统加速训练的早期反向传播调度方案
- AgRefactor:用于高层次综合(HLS)兼容性与性能的自进化智能体工作流
- KernelArc:面向GPU内核优化的多智能体框架
- 服务掩码扩散大语言模型:来自真实硬件的特征分析与设计原则
- QTEA:基于稀疏残差显著权重与按列优化的三值大语言模型
- HARP:用于极端大模型量化的哈 Hadamard 预处理自适应旋转处理器
- AI 智能体真的懂计算机体系结构吗?AutoTuring 基准测试揭示底层思考本质
硬件历史
硬件发现
硬件基准测试
硬件安全
硬件开发
硬件开源
硬件性能
硬件成本
硬件折腾
硬件描述语言
硬件改造
硬件架构
- APEX:面向内存高效的边缘端 MoE 推理的自适应专家预取技术
- SynAct:用于自适应综合优化的推理-行动大语言模型智能体
- DumpsterCluster:从“垃圾堆”到运行 LLaMA-70B 的 60 美元 GPU 集群
- PTXBench:利用架构专用 PTX 评估与适配大语言模型以进行 GPU 核函数优化
- 具备权威性的AI:从应用层到硅片
- Maia 200:面向大规模AI加速的软件定义数据流系统
- 超越扁平网表:用于时序电路可扩展分析的分层图表示学习
- LevelSyn:基于层异步图神经网络的物理感知逻辑综合
- TreeFI:面向深度神经网络的价值感知统计故障注入
- Golden Ruler:包含FP8、BF16、MXFP4及微标度格式位精确一致性向量的数字格式目录
- 面向长上下文大模型解码中密集片上NVM的接口感知KV缓存量化
- 从高斯点到硅片:重新审视 3DGS 的计算效率
- DCO:基于预测性管理的面向大模型加速器动态缓存编排
硬件测试
硬件算法协同设计
硬件组装
硬件设计
- 大语言模型用于Verilog代码生成:文献综述与未来之路
- 被诅咒的电路 #6:反向雪崩振荡器
- 带浮点运算功能的指针式仪表计算器
- 面向早期前原理图嵌入式系统设计的LLM驱动及数据手册感知自动化硬件兼容性验证
- 数字EDA中的大语言模型:从生成到编排的角色转变视角
- 面向嵌入式系统早期原理图设计阶段的LLM驱动、数据表感知型自动化硬件兼容性验证
- Redwood:由AI从零开始设计、验证并在2周内部署的前沿AI加速器
- 字典引导的变异算子:用于自动化 HDL 修复
硬件设计自动化
硬件调试
硬件部署
硬件验证
硬件黑客
硬约束
确定性保证
确定性控制
确定性推理
确定性策略
确定性编译
确定性防护
碳排放
碳足迹
磁共振成像
磁力计
磁约束聚变
社交偏见
社交机器人
社交网络
社会偏见
社会公益
社会关联
社会动力学
社会学
社会权威
社会科学研究
社会选择理论
神经信息处理系统
神经偏微分方程代理
神经元分析
神经元干预
神经元激活
神经元胞自动机
神经元逆向工程
神经元重要性
神经函数
神经基础模型
神经张量网络
神经形态硬件
神经形态计算
- PTQ4SNN:面向脉冲神经网络的膜电位感知后训练量化技术
- 面向持久化机器监测的低功耗神经形态声学异常检测
- 用于基于事件的神经形态目标分类的 ANTShapes 基准数据集
- 神经形态系统中结构吸引子的形成
神经影像
神经微分方程
神经机器翻译
神经架构搜索
神经模型
神经模糊系统
神经求解器
神经科学
神经符号AI
- 通过神经符号安全卫士引导端到端自动驾驶
- sLTN:结构化逻辑张量网络
- FormalAnalyticGeo:基于神经符号架构的多模态解析几何题目生成框架
- 知识图谱上的神经符号推理:基于查询视角的全景综述
神经符号学
神经符号学习
神经符号推理
神经符号方法
神经符号系统
神经符号计算
神经算子
- 面向长时序PDE预测的几何感知增量神经算子
- 面向无线场建模的物理展开神经算子
- GCNO:用于无线信道物理压缩的格拉姆切比雪夫神经算子
- 利用神经算子学习 Kohn-Sham 映射以实现准线性标度的密度泛函理论
- 神经算子的保角不确定性量化保证
神经网络
- HYDRA:科尔莫哥洛夫-阿诺德网络的双曲动态表示架构
- 科学数据高保真学习压缩的残差建模
- CutClean:面向隐私保护推理的神经网络剪枝方法
- 通过可解释神经网络揭示纳米晶合成的尺寸决定机制
- 从基函数的视角重新审视不规则时间序列预测
- 异构边缘-云连续统中的自适应人工智能任务划分与安全卸载
- 基于张量分解的导频受限MIMO信道结构化估计
- 不可训练元件决定了物理学习的记忆内容
- TinyML 系统的功耗与性能特性分析
- 用于实时托卡马克平衡预测的AI代理模型:神经网络架构基准测试与EXL-50U验证
- 推理捷径与价值对称性:对称性所允许的、架构所实现的与优化所选择的
- ER-KANs:面向数据稀缺科学机器学习的高效且鲁棒的柯尔莫哥洛夫-阿诺德网络
- CG4AI:一种用于约束条件下训练 AI 模型的列生成框架
- 超越搜索模仿:免搜索国际象棋的先验导向探索
- 通过卢卡谢维奇逻辑完全识别深层ReLU网络
神经网络优化
神经网络动力学
神经网络可塑性
神经网络可解释性
神经网络审计
神经网络架构
神经网络架构优化
神经网络激活
神经网络电路
神经表示
神经计算
神经量子态
福利经济学
离散对数
离散扩散
离散扩散模型
离散数学
离散流匹配
离线优先
离线到在线归约
离线强化学习
离线环境
离群值消除
科学AI
科学事实核查
科学发现
- 智能体自主研究即模糊测试 (arXiv:2608.09855 [cs.AI])
- 基于循证的科学问题发现:融合历史回测的框架
- 大语言模型无法实现科学认知的‘跨越’
- 观点:科学团队中的AI智能体应作为人机系统进行研究
- 迈向自动化研究:利用具有范畴结构的论文知识图谱挖掘可证伪的研究构想
- 生物学中AI模型的高效自动可解释性
- 元认知引导:学习科学判断的内在结构
科学命名实体识别
科学基准
科学声明
科学实验
科学推理
科学文献
科学文献挖掘
科学智能
科学智能体
- EarthVerse:跨动态地球系统与自然灾害的科学智能体基准测试
- 自进化科学智能体发现可泛化的具物理推理能力流体控制策略
- 自进化科学智能体设计具备物理推理能力的白盒流体控制
- K-Bench:衡量模型在真实科学智能体请求上的性能
- 科学智能体技能:面向研究智能体的程序化知识库
科学机器学习
- ArGEnT:用于算子学习的任意几何编码 Transformer
- ER-KANs:面向数据稀缺科学机器学习的高效且鲁棒的柯尔莫哥洛夫-阿诺德网络
- AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索
- 看见、假设与验证:用于发现控制偏微分方程的多模态智能体框架
科学研究
科学研究自动化
科学社会学
科学自主
科学自动化
科学范式
科学计算
- 科学数据高保真学习压缩的残差建模
- SAFE-SVD:面向物理基础模型的敏感感知保真度强制奇异值分解
- AutoXRD:用于粉末衍射分析的自主大模型智能体与综合评测
- PETSc 中 AI 生成科学计算代码的智能体评估框架
科学计量学
科学诚信
科学软件
科技情报
科研构思生成
科研评估
移动应用
移动应用生成
移动操作
移动智能体
移动端AI
移动端GUI智能体
移动端应用
移动端智能
移动端智能体
移动计算
稀疏人工智能
稀疏图
稀疏奖励
稀疏嵌入
稀疏性
稀疏注意力
- 注意力头的自主性:利用冻结的查询-键几何实现免数据的稀疏注意力机制
- 划分支撑集,重建残差:面向视频生成与世界模型的免训练稀疏注意力机制
- BF1:面向高效长文本 Transformer 的因果二元稀疏注意力改造方案
- 语言模型能够自主控制注意力
- DeepSeek AI 发布 DeepSeek-V4.1-Flash:支持 1M 上下文、FP4 KV 缓存与跨层注意力复用
- HISA:面向细粒度稀疏注意力的高效分层索引机制
稀疏自编码器
- 每个模型一个适配器对:语言模型的通用激活接口
- 稀疏原型代码构成了跨模态分类与预测的基础
- 面向低资源非洲语言的潜空间拒绝锚定:无需重新训练的机械式安全恢复
- 通过几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性
- REINS:基于稀疏自编码器特征的拒绝增强抑制性调控
- 生物学中AI模型的高效自动可解释性
- 通过基于SAE的引导解决知识冲突的关键路径识别
稀疏视角CT
稀疏计算
稀疏阅读
稀缺资源分配
程序化内容生成
程序化文体学
程序化知识
程序可执行性预测
程序合成
程序学习
程序思维
程序语义
程序进化
税务优化
稠密架构
稳定性
稳定性边缘
稳定秩
稳态孤子
空气质量预测
空间可迁移性
空间基础
空间定位
空间探测
空间推理
空间数据库
空间时序动态
空间时间Transformer
空间智能
空间望远镜
空间机器人
空间注意力机制
空间混叠
空间结构
空间规划
空间计算
空间认知
空间记忆
空间音频
穿戴式AI
突悟现象
竞技编程
童工监测
端侧AI
端侧大模型
端侧模型
端侧部署
端到端学习
端到端架构
端到端规划
端到端语音
符号AI
符号反向传播
符号回归
符号表示
符号计算
符号识别
符号逻辑
符号遮蔽
符号音乐
第一人称视角
第一性原理
第一视角视频
- EgoCITE:面向长时序第一视角记忆的上下文增强索引与时间感知检索
- 解码前声学分诊:面向预算限制下未剪辑第一视角视频的视觉语言描述生成
- Ambient @ EgoProactive 2026:基于视觉基础监督的主动式第一视角辅助系统
- Ambient @ EgoProactive 2026:基于视觉定位监督的主动式第一视角穿戴式助手
等变神经网络
等待策略
等离子体平衡
答案工程
策略优化
- 全象限有界裁剪 GRPO:消除无界盲区以实现稳定且泛化的训练
- DiDPO:面向编程智能体训练的差分双重策略优化
- GCPO:诊断与约束大模型 Rollout 强化学习中的子空间几何
- 超越结果奖励:面向深度搜索智能体的步级自蒸馏策略优化
- CoupVisor:基于回合与质疑决策支持的策略优化
- PlanPO:面向多轮智能体大语言模型的群组规划感知策略优化
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- SkillGate:长程智能体中策略内技能选择的训练方法
- HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化
- MetaRAG:面向智能体RAG的信念-动作对齐策略优化
- 对比分支策略优化 (CBPO)
- RTPO:用于稳定智能体强化学习训练的反向轮次策略优化
- 在线蒸馏相遇离线GRPO:训练紧凑型指令遵循重排器
- SRPO:多智能体大语言模型的集合相对策略优化
策略决策
策略微调
策略感知
策略控制
策略校准
策略梯度
策略治理
策略漂移
策略网络
策略蒸馏
策略计数
策略评估
算力优化
算力功耗
算力基准
算子优化
算子学习
算子融合
- PyTorch 性能剖析(第三篇):注意力机制(Attention)全解析
- Nova:面向深度学习的端到端 MLIR 编译器
- 深入探秘 NVIDIA cuDNN Graph API:基于 Frontend 的算子融合、自动调优与计划复用
算子解耦
算法
算法优化
- DASH:用于自动化贝叶斯优化的解耦自适应代理-采集框架
- 当草稿模型在进化:投机解码与在线学习的完美结合
- Fast LapSum:百万级规模下的精确可微 Top-k 算子
- PACE:用于自动化算法设计的原语感知代码演进
- 跨位置与服务类别的受保护容量预算自适应两级分配
- 从单向扫描到边界缝合:交错式跨块后训练量化
- 不匹配至关重要:超越Token一致性的在线蒸馏技术
- 评分标准随机丢弃(Rubric Dropout):缓解以评分标准为奖励的强化学习中奖励攻击的简单方法
- A-3PO:利用感知陈旧性的近端策略近似加速异步大模型训练
- SBCO:面向规划智能体的自监督、验证器基础测试框架优化
- 用树结构打破链条:具有 \(mathcal{O}(log N)\) 时间复杂度的模型并行深度学习
- ERASE:用于现代推荐系统加速训练的早期反向传播调度方案
- 基于类别的启发式选择算法求解飞行积木拼图
- 摆脱冗余推理:面向推理阶段大语言模型的结构感知搜索
- 预训练进展主要来源于数据
算法偏见
算法公平性
算法分析
算法分类
算法创新
算法加速
算法博弈论
算法可靠性
算法合成
算法基准
算法基准测试
算法复杂度
- Riemann GeoResolver:从欧几里得解析器到双曲-球面几何的非欧几里得注意力框架
- 轴心与站点多智能体路径规划:可解性、复杂性与算法
- 罗马诺夫三元组逻辑的形式化验证:用于滑动窗口3-CNF的经验证过滤器及其在结构化公式中的应用
算法复杂性
算法性能
算法效率
算法极简主义
算法演化
算法稳定性
算法竞赛
算法能力
算法蒸馏
算法设计
算法评估
算法选择
算法防御
算法陷阱
算法验证
类型驱动
类比推理
类激活映射
粉末衍射
粒子加速器
精准农业
精度
精神病学
系外行星
系统一致性
系统与控制
系统优化
系统可靠性
系统安全
- 可信智能体网络:智能体网络中的信任必须是原生构建的,而非事后补救
- 自动驾驶中的边缘案例检测:方法、挑战与未来方向
- SimVerity:模拟智能体成功何时能在物理部署中转化为现实?
- 多租户大模型服务中KV缓存定时侧信道竞争诱发的可靠性崩溃特征研究
系统工程
系统性综述
系统性能
系统架构
- 新兴的零售投资组合管理应用:基于自然语言目标的个性化、税收意识强化学习
- RecSys Factory:将大模型智能体自主性限制在工业推荐系统生命周期的决策点上
- 绝不返回具体数值:面向以事实形式消费答案的 AI 系统的结构性弃权
- 工程化可靠的编程智能体:评估与运维模型周边的系统
- 从大模型推理到智能体工作负载:服务系统的特征分析与启示
- Ansari:一个基于检索增强的伊斯兰AI助手——14万次对话的架构、部署与经验教训
- Simthesizer:面向大模型推理服务系统的智能体驱动仿真框架
- SuperLocalMemory 4.0:面向AI智能体的受管控内存操作系统
- 静态分配与恒定工作量:构建高可靠系统的架构模式
- Perplexity 详解其 GPU 嵌入技术栈:Ivy、Tulip 和 ROSE 如何支撑 pplx-embed
- 脚手架内部的上下文工程:战胜长程任务中上下文溢出与目标迷失的 4 大机制
系统演示
系统管理
- Systemd 用户服务单元与特殊 Shell 带来的意外挑战
- 我们向沉闷(服务器)主机名的渐进转变
- 使用 PAM 阻止 SSH 登录(至少在 Linux 上)
- 我们不再使用 Linux 的严格内存超售模式
- 思考模型:授权与能力
系统综述
系统编程
- 分析 Linux 上 Go 1.27 程序的内存映射
- Zig 的 Io.Threaded 设计精妙
- 周末趣谈:你的进程内存其实就是一个文件
- Syncthing 与 SQLite 的一个“大坑”
- 标准库遮蔽:主流编程语言的模块加载陷阱与 AI 智能体安全危机
系统设计
纠偏机制
纠正流
纠错码
红蓝对抗
红队测试
纤维化定量
约束丢失
约束优化
- MACS:用于可靠对话式电商推荐的混合多智能体框架
- 面向关键任务基础设施运营的LLM智能体任务感知约束适配
- 大模型引导的图生成方法用于基于结构的局部改进优化
- 基于约束引导的大语言模型企业数据映射
- CG4AI:一种用于约束条件下训练 AI 模型的列生成框架
- 非凸优化中的运行机制:基于乘子的分类法
约束发现
约束感知
约束求解
约束满足
约束满足问题
约束生成
约束规划
约束解码
约束遵循
级联路由
纳什均衡
纳米晶合成
纸牌游戏
线上优化
线性Transformer
线性代数
线性复杂度
线性探测
线性时序逻辑
线性注意力
- TreeWY:门控DeltaNet混合模型的投机验证
- GLM-5.3-Flash 对比 Qwen3.8-Flash-Next:两家中国 AI 实验室如何独立收敛于相同的模型架构
- 动态路由器需要记忆吗?HeRo:面向高效大模型推理的历史感知路由机制
线性规划
线程池
组合优化
- 并非所有问题都适合建模为 MILP:一种面向 DSL 的灵活且精确的优化建模框架
- AHD Agent:用于自动启发式设计的智能体强化学习
- 使用 CPMpy 将有限域整数约束模型翻译为 CP/SMT/ILP/PB/SAT 求解器
- 无需求解器的可解推箱子(Sokoban)生成:基于扩散模型的方法
- 综合特征提取器:用于算法选择的智能体方法
- 通过形式化抽象提升资源受限语言模型中的自然语言组合优化准确率
- 基于记忆增强的神经求解器用于路径优化问题
- 强化学习引导的演化策略优化用于偏好可调的异构敏捷对地观测卫星调度
- FLARE:利用基于大语言模型的定理证明验证混合整数线性规划重构
- GraphMemix:面向长期多模态智能体内存的查询感知证据森林
- FLARE:利用基于大语言模型的定理证明验证 MILP 重构
- 强化学习增强的大语言模型智能体求解复杂车辆路径问题
- 历经二十年的 frb100-40:最优性证书与预注册搜索研究
- 适应不断演变的需求:用于零售供应链运营的智能体化 AI
- SPD:生成式重排的单次前向传递解码方法
组合多臂强盗
组合式攻击
组合式泛化
组合性
组合数学
组织病理学
细粒度识别
细胞扰动
细胞自动机
终局性
终止机制
终端任务
终端智能体
终端模拟
终端编码代理
终身MAPF
终身学习
经典分析
经典回顾
经典学习理论
经典规划
经济学
经济学模型
经济学模拟
经验框架
经验研究
- 深入剖析 EvoMap:自进化智能体间协作网络的特性研究
- 影响力策略重要吗?大语言模型代码生成中提示词框架效应的研究
- 思维链何时有效、何时失效:大模型推理中串行深度瓶颈的实证研究
- AI 模型如何管理认知权威:针对用户异议回应的分类法与比较分析
经验蒸馏
结构保持
结构动力学
结构化学习
结构化推理
结构化提取
结构化数据
结构化文档
结构化漂移
结构化证据
结构化输出
- 你的提示词并非唯一的提示词:大模型对结构化输出模式描述的权重究竟有多高?
- 大规模有限集约束解码的字典树自动机
- 位置与内容:解构大模型结构化输出中的结构与内容错误
- 保持在边界内:基于距离引导解码的保证上下文无关文法合规性
- 通过 100 步 GRPO 微调 350M 模型以获得更好的结构化输出
结构化预测
结构吸引子
结构因果模型
结构学习
结构工程
结构性弃权
结构感知
结构生物学
统一内存
统一架构
统一框架
统计估计
统计偏差
统计偏误
统计分析
统计力学
统计学
统计学习理论
统计学应用
统计学方法
统计方法
统计机器翻译
统计模型
统计物理
统计迁移
综述研究
综述论文
绿色AI
绿色计算
缓存优化
缓存机制
缓存编排
缓存重用
缓解策略
编排框架
编排调度
编码代理
编码智能体
- 面向编码智能体的全局可重用技能学习
- 是什么让软件问题解决任务对智能体来说如此困难?
- 使用编码智能体进行自动研究:古兰经诵读数据上的泛化者与指标最大化者
- 编码智能体是否需要可执行世界模型、简化和验证来解决 ARC-AGI-3?
- 使用编码智能体进行自动研究:古兰经朗读数据上的泛化者与指标最大化者
- RealSWE:真实用户请求下编码智能体的组合式评估
- 多套具现强化学习学到了什么?编码智能体中的归因与可迁移性
编码理论
编码问题
编程基础
编程技巧
编程智能体
- DiDPO:面向编程智能体训练的差分双重策略优化
- 编程智能体的在线监控与纠偏导向
- 个性化技能能帮助编程智能体吗?开发者交互历史的实证研究
- 语言服务器能为编程智能体节省Token吗?测量方法与初步研究
- 工程化可靠的编程智能体:评估与运维模型周边的系统
编程竞赛
编程语言
编程语言语义
编程辅助
编译优化
编译器
- PTXBench:利用架构专用 PTX 评估与适配大语言模型以进行 GPU 核函数优化
- 具备权威性的AI:从应用层到硅片
- Nova:面向深度学习的端到端 MLIR 编译器
- Nova:面向深度学习的端到端 MLIR 编译器
- 标准库遮蔽:主流编程语言的模块加载陷阱与 AI 智能体安全危机
编译器优化
编译验证
编辑保真度
缩放向量
缩放定律
缩放规律
缺失模态
缺失模态鲁棒性
缺血性卒中
网格细胞
网络区划
网络协议
网络威胁情报
网络安全
- 提示词注入的解构:一种用于结构化分析的组件模型
- 抵御知识投毒与提示词注入的检索增强型入侵检测防御机制
- 大语言模型智能体系统中潜在妥协的组合威胁分析:66号令场景
- 评估网络安全中大语言模型生成的检测规则
- 智能体网络安全的下一个挑战:一个现实且无污染的逆向工程基准
- BrowseSafe:理解并预防 AI 浏览器智能体中的提示词注入
- 基于扩展假设在无标签情况下评估智能体学习框架能力
- 结构化但脆弱:论大语言模型在网络安全决策中的局限性
- InjecMEM:针对大模型智能体记忆系统的内存注入攻击
- SENTINEL-RL:将拓扑推理从安全运营中心(SOC)的LLM智能体中剥离
网络排查
网络流媒体
网络编程
网络诊断
网络验证
网页自动化
网页解析
罕见病诊断
罗马乌尔都语
群体极化
群集智能
耳蜗植入
聊天模板
职业偏见
职场风险
联合优化
联合信源信道编码
联合嵌入预测架构
联想记忆
联盟形成
联邦学习
- 绕过 Krum:联邦学习中的感知选择性后门攻击
- FedCGR:联邦跨域生成式推荐
- 基于层论的联邦表示学习
- MoE 路由引导的异构联邦指令微调聚类方法
- FedImp:基于杂质度加权的联邦学习收敛性增强
- 正则化在平均化后能保留多少?联邦学习中的更新掩码机制
- FedV-KGQA:基于垂直划分知识图谱的多跳问答框架
- ORBITALIF:一种用于星载去云的高效脉冲联邦学习框架
- 联邦化几乎免费,推理则不然:蛋白质表征工作流中 AI 联合科学家的权衡
- 跨四个国际胸部X光队列的BiomedCLIP联邦LoRA自适应研究
- 基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全性
- 联邦学习中破坏模型置信度的温度缩放攻击
- 联邦学习框架下X射线透视中导管与导丝分割的新方法
- 面向智能体网络的类型化联邦构件:在冻结的异构LLM智能体间共享工具路由知识
聚合函数
聚合物模拟
聚合评分
聚类分析
聚类算法
股票研究
肺癌
肺癌诊断
肺结节
胜率预测
胸部CT
能力对齐悖论
能力评估
能动性理论
能效优化
能效比
能源互联网
能源管理
能量模型
脆弱性图谱
脉冲神经网络
- PTQ4SNN:面向脉冲神经网络的膜电位感知后训练量化技术
- SAGE:基于注意力引导熵的脉冲Transformer替代梯度自适应方法
- ORBITALIF:一种用于星载去云的高效脉冲联邦学习框架
- 用于基于事件的神经形态目标分类的 ANTShapes 基准数据集
脊柱侧凸筛查
脑机接口
脑电图
脑电波传感
脑血流图
脑部MRI修复
脓毒症
腾讯
膜电位感知
自一致性
自主实验者
自主智能体
自主研究智能体
自主科研智能体
自主软件开发
自传生成
自动代码修复
自动作文评分
自动写作
自动化
- 上手树莓派 CM5 编程夹具:工厂级批量烧录利器
- 我们的仆人会代劳:自动化与人类工作的未来
- 终端智能体:命令行环境下的 AI 智能体综述
- VortexChat:用于自主多目标集成光子设计的智能体框架
- 数字EDA中的大语言模型:从生成到编排的角色转变视角
- 自然语言输入、语义轨迹表示与大模型推理:让海事信息交换模型变得易于实现
自动化交付
自动化仓储
自动化仿真
自动化修复
- 是什么阻碍了智能体技能的复用?来自 138K 个 SKILL.md 文件的实证研究
- Kozuchi Agent:用于软件修复的语言无关开源权重智能体
- 字典引导的变异算子:用于自动化 HDL 修复
- 历史即检测器:端到端执行CVE补丁历史
自动化创造力评估
自动化启发式设计
自动化安全补丁
自动化定理证明
自动化工作流
自动化工程
自动化建模
自动化形式化
自动化微分
自动化技能生成
自动化推理
自动化数学发现
自动化数据科学
自动化机器学习
自动化检测工程
自动化测试
自动化演进
自动化研究
- AI智能体能否进行开放式AI研究?两项案例研究的初步证据
- 不会“跑偏”的AI科学家:四足机器人导航研究循环中的学术品味、结构化设计与可证伪发现
- ARAC:端到端科研中自动化研究对齐与完整性的基准测试
- VALG:用于机器学习理论研究的智能体系统
- DSA:面向多市场股票研究的证据感知型大模型智能体编排框架
自动化研究循环
自动化科学
自动化科学发现
自动化科研
自动化筛选
自动化算法设计
自动化红蓝对抗
自动化组题
自动化编程
自动化规划
自动化解释
自动化设计
- PICopilot:基于大语言模型的智能体框架,助力光子集成电路脚本化设计
- AaLLM:使用大语言模型实现从拓扑生成到尺寸优化的端到端模拟电路设计框架
- ATLAS:基于嵌入引导质量多样性搜索的LLM无支架算法合成
自动化评估
自动化调试
自动化运维
- InfraBench:跨层级、全生命周期与风险评估的基础设施智能体基准测试
- Meta 如何确保部署安全性:持续变更安全性的健康检查机制
- InfraBench:跨层级、全生命周期与风险维度的基础设施智能体评估基准
自动化部署
自动化配置
自动化采购
自动化验证
自动学习
自动定理证明
自动形式化
自动扩展
自动控制
自动数据生成
自动机
自动机与AI
自动特征工程
自动研究
- 个性化自动研究:迈向真正的 AI 共同科学家
- 迈向自动化研究:利用具有范畴结构的论文知识图谱挖掘可证伪的研究构想
- 使用编码智能体进行自动研究:古兰经诵读数据上的泛化者与指标最大化者
- 使用编码智能体进行自动研究:古兰经朗读数据上的泛化者与指标最大化者
自动翻译
自动规划
自动证明
自动评估
自动评分
自动语音识别
自动调优
自动驾驶
- 探究自动驾驶轻量级视觉语言模型中的视觉概念探测
- WAM-Diff2:用于高效率自动驾驶VLA的分层自回归到扩散蒸馏
- 开放世界分层感知:基于类别无关提议的分类抽象,实现对词表外道路物体的安全处理
- 基于多任务一致性的对抗攻击检测
- 通过神经符号安全卫士引导端到端自动驾驶
- 威胁引导的策略感知场景扰动:基于在线强化学习的安全自动驾驶
- XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链
- RadarGen:基于摄像头的车载雷达点云生成技术
- 自动驾驶中的边缘案例检测:方法、挑战与未来方向
- 面向混合架构的视觉-语言-动作模型高效块级并行推理
- HMS-SCP:面向车路协同感知任务导向的多尺度语义通信
- 基于物理基础的端到端驾驶规划器因果审计
- 面向长文本自动驾驶的规划对齐 Token 压缩
- 自动驾驶课程学习的规模化扩展
- 基于强化学习的欧拉式车头时距控制缓解高速公路拥堵
- PhaseShift:信号交叉口之间的拓扑感知数据同构化与模型整合
- 压缩驾驶策略中能力损失与恢复的闭环评估
- CauseCollab:用于异构协同感知的因果统一与模态无关网络
- 面向微型阿克曼车辆端到端自动驾驶的低成本开源平台
- LightEMMA:视觉语言模型自动驾驶能力的纵向评估
自动驾驶实验室
自反思
自回归
自回归Transformer
自回归模型
自学习
自学习知识
自对弈
自我修改系统
自我修正
自我偏好
自我博弈
自我反思
自我复制
自我提升
自我改进循环
自我演进
自我纠错
自我进化
自我进化智能体
自我验证
自改进智能体
自改进框架
自旋模型
自条件机制
自洽性
自然梯度
自然灾害
自然语言处理
- SCP-NL2TL:结合语义验证与选择性保形预测的自然语言转时序逻辑规范框架
- 新兴的零售投资组合管理应用:基于自然语言目标的个性化、税收意识强化学习
- 超越序列顺序:Transformer 的句法感知位置编码
- 基准测试的基准:评估对话智能体评测集
- 填补鸿沟:用于统一多任务用户意图推理的双知识图谱框架
- 通过随机数生成缓解大模型作为裁判时的评分偏差
- 大语言模型的地理空间概念探测:抽象性、组合性与基础性
- 跨资源区间的依存句法分析:评估高资源与低资源语言上的架构性能
- 缓解英语到罗马尼亚语机器翻译中的性别偏见
- CORA-Diff:面向高效扩散语言模型推理的置信度导向残差接受机制
- 结构性沉默:当AI基础设施辜负代表性不足语言的使用者
- 评估指标能检测出文言文到英文翻译中的错误吗?
- DFM Mimir v1:仅使用合规后训练数据、在10B参数量级实现前沿性能的开源HRM模型
- 揭露人工智能多智能体系统中的对话偏见
- 法律检索增强生成(RAG)系统的幻觉问题究竟有多严重?
- 利用少样本学习与大语言模型分析科学文献中不同生物学性别的血压变化
- 同步 Logit 引导:现实世界中的隐写术
- PLeDO:基于电子病历数据的骨关节炎疼痛程度检测
- 亲爱的算法:用于统一搜索与推荐的注重精度优先的智能体意图层
- 当AI重写,分类器放松:针对讽刺与AI释义社交文本的不确定性感知的正面/负面情绪分析
- 用于论证分析的逻辑嵌入
- 基于认知动机的隐喻解释多维评估框架
- 文档计数不等于文本计数:Web-PDF 语料库统计中的单位偏差
- CoAL-RAG:一种兼顾复杂度感知的法律检索增强生成方法
- G-ReAct:通过结构-状态协同演化实现图引导的深度搜索
- CulTrace:追踪大语言模型内部的文化推理过程
- SuTRA:具备词根感知能力的结构统一分词算法
- 罗马乌尔都语仇恨言论分类:参数高效微调与提示工程的比较研究
- 乳腺癌多学科团队会议边缘AI医疗器械系统的开发与可行性评估
- CAI-DLLM:扩散语言模型的收敛感知推理
- 超越每字母两字节:西里尔文 AI 系统中的分词开销
- GUI元素定位中的词汇耦合:句子嵌入在移动端与Web端的标签追踪表现
- 英语-普纳语统计机器翻译系统:实证研究的若干见解
- 当名称跨越文字:蒙古世界历史实体对齐的源头依据基准
- NL2SHACL-Bench:自然语言转SHACL翻译的基准测试套件
- 从梯度提升树到深度推荐器:生产环境客服推荐系统迁移的实战经验
- 多语言仇恨言论检测的训练期可解释性:将模型推理与人类理由对齐
- 利用 Poly-Encoders 实现计算高效的自动化创造力评估
- MIMO:通过单语目标实现多语言信息检索
- 自然语言输入、语义航迹表示与大模型推理:让海事信息交换模型变得可行
- 大语言模型创造力自动评估的局限性
- pro-team 参加 LLMs4OL 2026:基于检索增强生成与词汇受限过滤 本体学习方法
- 使用多重编码器实现计算高效的自动化创造力评估
- 土耳其语RAG系统中分块与嵌入策略的对比研究
- “不太可能”究竟有多不可能?评估大语言模型对概率词汇的感知
- 在截断评分量表上使用双重差分法会制造出虚假效应:来自一项预注册大模型裁判审计的证据
- ExecRubrics:用于可验证且高效长文本评估的可执行工具增强评分准则
- 为什么所有大语言模型都对日本文化“情有独钟”?解析大模型中隐藏的文化与地域偏见
- (V)LMs 超越表面共现泛化能力的实证研究:来自跨模态数一致性的证据
- DiffIE:基于扩散模型的开放式信息抽取
- 给它空间!编码器中位置与语义表示的显式解耦
- 指令复制作为推理时控制基元
</think>无法停止推理:虚假思维链终止现象分析- 通过训练编译:将自然语言规范转化为本地神经函数
- 结构化忠实:面向多文档摘要的声明锚定归因方法
- 通过幻觉空间投影减少 Whisper 模型中的幻觉转录
- 激活引导能否捕捉多维度的作者风格?
- 基于隐式推理的强大且高效的安全护栏
- 构造即可归因:面向多文档摘要的声明锚定溯源
- TamilEOT:泰米尔语电话语音中语义轮次结束检测的数据集与模型
自然语言推理
自然语言理解
自然语言生成
自然语言转数据库
自由意志
自监督学习
- 面向细粒度广义类别发现的傅里叶自监督方法
- SBCO:面向规划智能体的自监督、验证器基础测试框架优化
- 切合个人实际:通用 SSL 表征在真实生活 PPG 情绪检测中的局限性
- CM-MAE:面向视觉-无线应用物理机理引导的跨模态自监督学习框架
- BenthicDINO:面向视角不变侧扫声呐表征的物理融合自蒸馏方法
- LeVJEPA:摆脱启发式规则的高效且可扩展的视频预训练
- Var-JEPA:联合嵌入预测架构的变分公式——弥合预测式与生成式自监督学习
- ViTAMINS:利用合成难负样本训练自监督视觉Transformer的实证研究
- 自监督视觉表示学习的三个必要原则
自监督预训练
自纠错
自组织电路
自编码器
自蒸馏
- AgentOPSD:面向智能体强化学习的递归自蒸馏方法
- 超越结果奖励:面向深度搜索智能体的步级自蒸馏策略优化
- 通过在线自蒸馏缓解大模型评判中的评分标准干扰
- 基于偏好的自蒸馏:通过奖励正则化超越 KL 匹配
自解释
自训练
自进化
- A-SR:基于分层协同的自进化智能体大模型符号回归
- MindMemOS:面向AI智能体的可移植自进化内存操作系统层
- 盲目的策展人:有偏见的评判者如何悄无声息地阻碍自进化智能体的技能淘汰
- TRACE:面向一致且具备边界意识的大模型智能体的自进化技能库
- MediSkill-Evo:基于过程约束的自进化技术实现有据可查的临床交互
自进化基础设施
自进化智能体
自进化系统
自进化网络
自适应停止
自适应推理
自适应比特率
自适应路由
航空安全
航空航天
航空运输
艺术创作
艾伦·图灵
芬兰交通
芯片布局
芯片设计
- 自主芯片设计中的智能体编排
- Redwood:由AI在两周内从零设计、验证并部署的前沿AI加速器
- Redwood:由AI从零开始设计、验证并在2周内部署的前沿AI加速器
- AI 智能体真的懂计算机体系结构吗?AutoTuring 基准测试揭示底层思考本质
范围类型
范畴论
荧光寿命成像
荧光显微镜
荧光灯
药物发现
药物毒性预测
莱斯定理
蒙古世界
蒙特卡洛方法
蒙特卡洛树搜索
虚假图像检测
虚拟人
虚拟化
虚拟座舱
虚拟智能体
虚拟筛选
虚拟细胞
虚拟节点
蛋白质工程
蛋白质折叠
蛋白质结构预测
蛋白质表征
融合算子
血压分析
血管介入
行为一致性
行为克隆
行为分析
- 查询时机导致大语言模型与人类在位置偏差上的截然相反
- 关注学生:在线学习中用于自动化参与度预测的行为与上下文线索
- 基于游戏轨迹的账号一致性:反恐精英2中的同玩家验证
- 从欺骗性输出到欺骗性机制:语言模型欺骗研究的因果框架
- 量化放大确定性而非偏见:服务时权重压缩的尺度依赖行为效应
- AgentDrift:带有步骤标签的提示词注入劫持大模型智能体轨迹基准
行为可控性
行为复发
行为对齐
行为感知
行为感知验证
行为指纹
行为提升
行为框架
行为监测
行为真实性
行为研究
行为科学
行为经济学
行为评估
行为语义
行为重编程
行为验证
行星级推理
行星轨道
街景定位
表征交接
表征几何
表征动力学
表征学习
- EEG-PRIME:基于多级条件机制和原型对齐表示学习的脑电图解码模型
- 相似性贯穿始终:大语言模型的多语言泛化依赖于语言层面的相似性结构
- 被动物体状态世界模型中运动学、接触及物体恒存场的事件条件诊断
- 切合个人实际:通用 SSL 表征在真实生活 PPG 情绪检测中的局限性
- BRo-JEPA:在潜空间中学习模块化变换
- RULER:机器遗忘的表征级验证
- RefusalGuard:大语言模型中保持几何结构的安全性微调方法
- Var-JEPA:联合嵌入预测架构的变分公式——弥合预测式与生成式自监督学习
- 当特征成为样本:用于无监督特征选择的倒置对比学习
表征对齐
表征工程
表征干涉
表征操控
表征空间
表征预训练
表格基础模型
表格数据
- 叶节点值作为坐标:梯度提升集成模型的精确对比解释
- 可操作的CBFI:将结构分解与因果反事实追索集成用于表格机器学习
- Var-JEPA:联合嵌入预测架构的变分公式——弥合预测式与生成式自监督学习
- 基于大语言模型的自适应岛屿图演化自动特征工程
- Xiaomi-TabLDM:表格基础模型技术报告
- 见证者解释异常:WAND——具备原生可解释性的无监督表格异常检测器
表格数据生成
表格理解
表格生成
表格问答
表示学习
表达能力
西里尔文
观测数据
规划即推理
规划器
规划控制
规划智能体
规划算法
- SIMGUIDE:基于程序化落地的多上下文表示法,赋能个性化智能体规划
- SIMGUIDE:基于程序化落地的多上下文表示,赋能个性化智能体规划
- 基于 SMT 的 HTN-SAT 编码实现数值型完全有序 HTN 规划
- 基于最优输运贝尔曼平滑的二阶平滑规划
规划能力
规格博弈
规范优先协议
规范博弈
视动模仿
视听扩散模型
视听推理
视点鲁棒性
视觉-语言-动作模型
- 流匹配不确定性的几何学:零成本不确定性代理及其在基于流的VLA故障检测中的应用
- XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链
- Pointing-VLA:面向视觉-语言-动作操作的类型化空间基础接口
视觉-语言模型
视觉Token剪枝
视觉Transformer
视觉上下文
视觉偏见
视觉先验
视觉动作模型
视觉压缩
视觉反射
视觉基础定位
视觉基础性
视觉基础模型
视觉基础监督
视觉多模态
视觉大模型
视觉定位
视觉层级
视觉幻觉
视觉推理
视觉搜索
视觉文档检索
视觉智能体
视觉概念探测
视觉模仿学习
视觉模型审计
视觉注意力
视觉理解
视觉策略
视觉编码器
视觉表征
视觉证据
视觉语言动作模型
视觉语言学习
视觉语言导航
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量化无人机导航潜能
- VTInstructor:用于连续环境中导航指令生成的视觉轨迹提示方法
- AeroDPO:通过高保真感知与自动化偏好优化释放轻量级无人机导航潜能
视觉语言模型
- 用一张纸劫持机器人:VLM控制机器人中物理提示词注入的系统性研究
- OSReward:建立跨平台电脑操作智能体奖励模型的标准化评估体系
- Capek 0.5:面向具身智能的以执行为中心的视觉语言模型
- DocMemo:基于概率记忆引导检索的多模态文档理解动态证据发现
- 一图胜千Token:视觉语言模型如何在大幅降低AI能耗的同时提升准确率
- CASA:基于安全注意力增强分类的鲁棒多模态对齐
- 探究自动驾驶轻量级视觉语言模型中的视觉概念探测
- 针对深度 OCR 系统的对抗性攻击
- 从恢复到断崖:动作后训练如何削弱视觉语言模型(VLM)的深层深度可解码性
- CoAdapt-GUI:针对未见GUI应用的联合工作流上下文与策略自适应
- 波兰语医学视觉问答:视觉语言模型未能充分利用视觉证据
- LongEarth-R1:面向长时序地球观测推理的视觉语言模型基准与对齐
- 由表及里、由远及微:基于贝叶斯推理引导的聚焦式 VLM 推理的高速公路监控视频高效远距离异常检测
- 视觉语言模型内部伪装视觉上下文的隐藏演化
- 放大并不意味着预测性:思考模型中的推理行为
- MedClaw:面向长程手术视频推理的启发式智能体架构
- 见红则思恶:视觉语言模型中的色彩偏见
- 基于视觉语言模型的游戏内容叙述系统
- BUZZY:通过对比打分缓解多模态多项选择问答中的文本诱导偏差
- 从通用走向专业:利用冻结视觉语言模型实现内窥镜息肉报告的上下文融合框架
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- 基于确定性几何与受控智能体视觉语言优化的结构图纸转模型方法
- SemComp-Bench:视频生成中的语义任务完成度基准评测
- 何时将苹果称为红色:人类遵循内省规则,而视觉语言模型(VLM)则不然
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- StateSight:基准测试视觉语言模型中的潜在空间状态重建
- 提示、评委与教师:视觉语言数学推理中稀疏奖励强化学习的先验注入
- 小型视觉语言模型在定性力学问题上的评估
- 基于查询的长文档多模态信息抽取
- 通过反事实集成解码减轻大型视觉语言模型中的偏见
- OVIBench:面向中断场景的在线视频问答基准测评
- 解码前声学分诊:面向预算限制下未剪辑第一视角视频的视觉语言描述生成
- 视觉语言模型中基于方向的推理时防御机制的跨架构审计
- ST-Lite:面向长程 GUI 智能体的免训练空间轨迹引导 KV Cache 压缩框架
- 陷阱何在?评估视觉-语言模型的时间一致性
- 解耦规划与控制:面向可指令智能体的 Instruct-to-Act 系统
- 一张表格价值64个Token:多表格文档问答的像素级压缩
- 解耦可指令智能体的规划与控制
- 大型视觉语言模型中用于缓解幻觉的动态对齐补偿方法
- 无证据提示:神经影像提及如何改变临床视觉-语言模型的预测
- (V)LMs 超越表面共现泛化能力的实证研究:来自跨模态数一致性的证据
- 跨四个国际胸部X光队列的BiomedCLIP联邦LoRA自适应研究
- 视觉语言模型是在阅读还是在重写?探究视觉语言模型中的转写忠实度
- SVG-Score:与人类偏好对齐的文本生成SVG评估方法
- WIDE:用于跨模态生成式检索的动态扩展通配符推理
- FailBench:视觉语言模型在判断机器人任务成功率方面有多可靠?
- LightEMMA:视觉语言模型自动驾驶能力的纵向评估
- 问两次,看两次:提示词回显解决了视觉语言模型中的“问题前置悖论”
- 面向视觉与语言Transformer的感知损伤多臂老虎机剪枝技术
- CUSP:多智能体多模态推理的可分解集体不确定性
- 蒸馏视觉语言模型以实现端侧火灾理解
- 大型视觉语言模型中涌现的目标导向注意力
- 更大的文本编码器可能会损害 CLIP 的零样本性能
- 视觉语言模型中思维链忠实度的反事实测试评估
视觉语音识别
视觉骨干网络
视触觉感知
视频世界模型
视频修复
视频关系代数
视频处理
视频大模型
视频定位
视频扩散模型
视频推理
视频描述
视频理解
- EgoMonth:用于长期时空记忆的月度级第一人称视频基准
- NARU:面向日本极长视频的叙事演进与文化细微差别理解基准
- 粗粒度索引,细粒度证据:长视频RAG中时间粒度的解耦
- 有什么玄机?评估视觉-语言模型中的时间一致性
- 陷阱何在?评估视觉-语言模型的时间一致性
视频生成
- SemComp-Bench:视频生成中的语义任务完成度基准评测
- 划分支撑集,重建残差:面向视频生成与世界模型的免训练稀疏注意力机制
- 从生成到模拟:世界模型距离真正的模拟器还有多远?
- GraphVid:交互式图可控视频生成
视频虚拟试穿
视频语言模型
视频预测
视频预训练
角色
角色扮演
角色条件设定
解剖学先验
解析几何
解码优化
解码方法
解码策略
解释理论
计划反排序
计划生成
计数反事实
计数反事实控制
计数反事实推理
计算力学
计算化学
计算器
计算均衡路由
计算复杂度
- 提示词的价值:一种大模型相对柯尔莫哥洛夫复杂度的方法
- 倒排索引遍历的 \(mathbf{P}\)-完全性:布尔查询 DAG 评估的计算复杂度研究
- 通过部分可观测随机博弈求解带有Omega正则目标的鲁棒POMDP
计算复杂性
- 推理捷径与价值对称性:对称性允许什么、架构实现什么以及优化选择什么
- 面向格罗滕迪克常数的长周期AI研究:人机数学协作案例研究
- 野火扑救:计算复杂性、数学模型与实例基准
- 推理捷径与价值对称性:对称性所允许的、架构所实现的与优化所选择的
- 通过部分可观测随机博弈求解具有 Omega-正则目标的鲁棒 POMDP
计算心理语言学
计算情感学
计算效率
- 在线推理校准:测试时训练赋能可泛化的共形大模型推理
- 通过感知I/O重构实现快速且内存高效的小波卷积
- 知道何时停止:大语言模型评估的贝叶斯最优停止策略
- 通过置信度动态实现大型推理模型的提前停止
- OceanLight:基于几何自适应非结构网格表示的高效全球海洋预报
- 解码前声学分诊:面向预算限制下未剪辑第一视角视频的视觉语言描述生成
- 预训练进展主要来源于数据
- 从高斯点到硅片:重新审视 3DGS 的计算效率
计算机体系结构
计算机使用
计算机使用智能体
计算机历史
计算机复杂度
计算机操作智能体
计算机科学
计算机科学教育
计算机网络
计算机视觉
- PD-GS:基于音素驱动3DGS的音频驱动说话人脸生成
- CogVis:开放词汇表变化检测是否需要为每个查询重新感知场景?
- 低频陷阱:视频语言模型在简单事件记账上的失败
- UniVVT:用于高保真视频虚拟试穿的统一端到端框架
- 基于深度引导的拥挤场景视频目标计数
- DeepForgeSeal:利用对抗性强化学习进行深度伪造检测的潜空间驱动半脆弱水印技术
- λSplit:用于荧光显微成像的自监督内容感知光谱解混模型
- TransSLR:用于手语识别的轻量级 Transformer
- SLED:通过知识蒸馏实现可扩展的位置编码
- 基于多智能体取证推理的通用深度伪造视频检测
- 通过零知识证明实现图像溯源的软修订
- EliSeg:基于报告定位的异常分割与验证目标构建
- 我在视频中寻找你:面向以人为中心视频推理的身份条件化查询
- 相同的注意力,不同的真相:结合 Logit-Lens 与视觉注意力来检测和缓解 LVLM 对象幻觉
- 使用深度学习图像分割和几何建模从零回波时间 MRI 中自动提取的测量结果与专家手工读数高度一致
- SignVerse-2M:一个包含 55 种以上手语、拥有两百万剪辑的姿态原生宇宙
- LoCA:视觉基础模型的空间感知低秩卷积自适应
- DSLE:黑暗之魂首领战学习环境
- BRACE:通过重心有理预测驯服尖锐不规则性,实现快速扩散 Transformer 推理
- 心脏介入手术中增强型实时六自由度扩展现实导管追踪技术
- 开放世界分层感知:基于类别无关提议的分类抽象,实现对词表外道路物体的安全处理
- 基于多任务一致性的对抗攻击检测
- REVEAL:用于长视频问答中显式证据充分性验证的评分标准引导智能体
- 基于敏感度建模的开放世界语义分割
- 面向细粒度广义类别发现的傅里叶自监督方法
- SignLlama:通过优先处理视觉特征增强无词汇表手语翻译
- 当隐空间遗忘像素:恢复扩散Transformer超分辨率中的保真度
- 小米 MiLM Plus 发布 PROVE:面向感知对齐的对象移除评估指标
- 面向多分类皮肤病变分类的不确定性感知的可解释集成深度学习框架
- SegPAR:面向语义分割的以类别为中心的基于决策的稀疏攻击
- 从多模态伪标签中学习:实现鲁棒的开放词汇实例与全景分割
- LoSA:无需训练的视频扩散模型加速:近乎无损的稀疏注意力机制
- 可解释计算机视觉中的类激活映射:CNN、Transformer与基础模型时代视觉解释的方法论中心综述
- 排序与分配:多视角目标关联中的指标不匹配问题
- 面向高光谱鱼类新鲜度分类的域感知轻量级光谱分组卷积
- 面向分层式人类动作识别的组合式基准测试综合生成
- MBA:面向现实世界商业构思的多模态基准与智能体
- 多层上下文伪装理论:面向防作弊在线评估的语义叠加与上下文叠层框架
- UniTraffic-Agent:2026年AI城市挑战赛赛道3的统一交通视频推理与双重跨领域评估
- 基于损失引导多专家GAN的手语视频合成
- RadarGen:基于摄像头的车载雷达点云生成技术
- 由表及里、由远及微:基于贝叶斯推理引导的聚焦式 VLM 推理的高速公路监控视频高效远距离异常检测
- 见红则思恶:视觉语言模型中的色彩偏见
- 基于视觉语言模型的游戏内容叙述系统
- 重新定义视觉领域的泛化能力:基于 FusionDetect 的双轴虚假图像检测框架
- PolyComp:用于评估多模态模型组合式 3D 空间推理能力的基于多方块立方(Polycube)的基准测试
- 人工智能作为打击童工的工具:用于儿童检测与年龄估计的实时边缘视觉流水线
- VGGT-Align:架起长序列三维重建中局部重建与全局一致性的桥梁
- CG-GLORE:用于稀疏视角CT重建的基于共轭梯度的全局-局部正则化网络
- 外表可能具有欺骗性:众包航空灾害评估中跨影像来源的标注者与审核者表现
- 面向超高分辨率遥感图像分割的分层自适应特征精炼网络
- CM-MAE:面向视觉-无线应用物理机理引导的跨模态自监督学习框架
- 肺癌组织病理学深度学习架构的综合基准测试
- TokenSTFormer:用于青少年特发性脊柱侧凸筛查的整体运动分析分词时空注意力模型
- 深度思考对齐:用于视频推理的轨迹级潜在蒸馏
- 结果一致而视线分歧:具中心凹视觉的多模态大模型如何进行视觉搜索?
- PXDepth:用于保持结构特征的单目深度估计像素空间建模
- 基于确定性几何与受控智能体视觉语言优化的结构图纸转模型方法
- SemComp-Bench:视频生成中的语义任务完成度基准评测
- 使用合成数据训练热红外图像中的无人机检测
- UltraArUco:一种用于移动端增强现实交互的轻量级多语言低延迟实时标记追踪库与框架
- FUSE:基于面部视频的帧统一应激估计
- 划分支撑集,重建残差:面向视频生成与世界模型的免训练稀疏注意力机制
- 学习状态感知的面向小规模数据集动态生成式数据增强
- 使用 deepDoctection 构建端到端文档智能流水线
- StateSight:基准测试视觉语言模型中的潜在空间状态重建
- 身份感知的人机交互动作描述生成
- CIVA:针对视觉世界模型智能体的评论者诱导价值子空间攻击
- 面向卫星视觉Sim2Real数据构建的组件感知保结构风格迁移
- 弱监督概念瓶颈学习:实现鲁棒的两阶段以物体为中心的视觉推理
- 通过反事实集成解码减轻大型视觉语言模型中的偏见
- 构建用于基于人工智能的连续环形撕囊术技能迁移的预测性手术路径
- 可缩放矢量图形的潜在空间
- LiteEvent-AE:面向低延迟、受限能耗边缘设备的事件相机轻量级自编码器
- 用于视觉表征学习的双曲层次聚类
- DF-MoE:基于多模态稀疏混合专家的通用深度伪造检测
- 保真度偏好,而非人口统计学偏好:图像美学/偏好评分器的像素级属性敏感度审计
- 通过CT阅片过程中的3D注视模式预测放射科医生的专业水平
- 关注学生:在线学习中用于自动化参与度预测的行为与上下文线索
- GraphVid:交互式图可控视频生成
- 位置即全部:基于MLLM指代表达式分割的免费午餐式Token压缩策略
- X\(^2\)Localizer:用于渐进式跨视角视频地理定位的跨粒度对齐方法
- 位置即全部:基于多模态大语言模型的指代表达式分割免训练Token压缩策略
- 用于基于事件的神经形态目标分类的 ANTShapes 基准数据集
- CoGeo-GS:3D场景中基于概念驱动与几何感知的多物体擦除
- PailitaoGR:生成式图像检索的潜在图像思考框架
- LeVJEPA:摆脱启发式规则的高效且可扩展的视频预训练
- Egosurg:利用环境摄像机进行手术室工作流第一人称回放的任意视角合成
- CounterVid:用于缓解视频-语言模型中动作与时间幻觉的反事实视频生成
- X\(^2\)Localizer:用于渐进式跨视角视频地理定位的跨粒度对齐框架
- 基于边缘端YOLO与RT-DETR的深度感知路面坑洼检测
- 逻辑门网络的深度可扩展性研究
- ViTAMINS:利用合成难负样本训练自监督视觉Transformer的实证研究
- 基于扩散大语言模型的视觉语音识别
- GeoSPRINT:扩散轨迹推理中基于几何冗余感知的步数剪枝
- Shiva-DiT:用于高效扩散 Transformer 的基于残差的可微分 Top-\(k\) 选择方法
- 自监督视觉表示学习的三个必要原则
- SVG-Score:与人类偏好对齐的文本生成SVG评估方法
- InSituMeasure:利用多模态大模型探究工业场景中的情境化测量基础
- GraFT:通过3D场景图实现多模态大语言模型空间推理的免训练框架
- 问两次,看两次:提示词回显解决了视觉语言模型中的“问题前置悖论”
- 基于未纠正几何畸变影像的卫星机载甲烷检测技术
- 大型视觉语言模型中涌现的目标导向注意力
- 更大的文本编码器可能会损害 CLIP 的零样本性能
- 视觉语言模型中思维链忠实度的反事实测试评估
- 联邦学习框架下X射线透视中导管与导丝分割的新方法
- Ambient @ EgoProactive 2026:基于视觉基础监督的主动式第一视角辅助系统
- Ambient @ EgoProactive 2026:基于视觉定位监督的主动式第一视角穿戴式助手
计算机视觉与自然语言处理
计算机辅助设计
计算机辅助证明
计算材料科学
计算模拟
计算生物学
计算病理学
计算社会选择
计算神经科学
计算语言学
计算资源
计算资源分配
计算预算
计量经济学
认知偏差
认知分析
认知协同演化
认知可串行化
认知可塑性
认知地图
认知抽象
认知时序逻辑
认知权威
认知架构
认知框架
认知科学
- AI 辅助验证中的认知迁移:框架与评估协议
- 查询时机导致大语言模型与人类在位置偏差上的截然相反
- 相似性贯穿始终:大语言模型的多语言泛化依赖于语言层面的相似性结构
- 大语言模型无法实现科学认知的‘跨越’
- 自动还是受控?重复启动效应揭示了基础大模型、指令大模型与人类的思维处理分化
- 结果一致而视线分歧:具中心凹视觉的多模态大模型如何进行视觉搜索?
- 拦截袋鼠:基于人工词库、主动探查以及利用大语言模型作为信息提供者与假设提出者的实验性星际语言学
- 何时将苹果称为红色:人类遵循内省规则,而视觉语言模型(VLM)则不然
- 儿童的学习效率为何依然超越AI——至今仍是一个谜
- 揭示大语言模型中类人表征的计算要素
- 衡量大语言模型中的推理质量:多维度行为框架
- 推断人工代理的情感意识:一个案例研究
- 大型视觉语言模型中涌现的目标导向注意力
认知行为疗法
认知记忆
认知负荷
认知防火墙
认证授权
认证鲁棒性
训练优化
训练动态
训练后压缩
训练后量化
训练数据
训练无关
训练稳定性
记忆定位
记忆层
记忆引导检索
记忆投毒
记忆智能体
记忆机制
- PHASE-Tree:长程角色扮演对话中的角色状态演化建模
- GraphWake:基于大模型智能体社区中记忆介导的极化级联效应引发群体极化
- 真实软件历史中的时间有效性:基于GitHub修复消除代码助手记忆中的陈旧事实错误
- DiaRelay:利用恒定大小内存进行对话情感识别的对话上下文传递机制
记忆架构
记忆检索
- PrimeAgentOrchestrator:面向个人 AI 基础设施的记忆预加载智能体衍生系统
- 受限预算的具身感知:四个资源壁垒与31B以下开源模型上访问结构化感知的预注册评估
- 当用户不再主动提问:对话式智能体中上下文驱动记忆检索的基准评测
记忆污染
记忆管理
记忆系统
- MindMemOS:面向AI智能体的可移植自进化内存操作系统层
- EgoCITE:面向长时序第一视角记忆的上下文增强索引与时间感知检索
- 加权记忆树:为长程 LLM 智能体保留关键信息
- InjecMEM:针对大模型智能体记忆系统的内存注入攻击
记忆网络
记忆蒸馏
记忆迁移
论文代码对齐
论文复现
论文征集
论文生成
论文解读
论证分析
讽刺检测
访问层级模型
访问控制
- 有界智能体:多智能体AI系统的委派安全性
- 在上下文之前授权:针对智能体系统中跨受众内存泄漏的模型中立受众边界
- Agent libOS:面向受能力控制的自进化大模型智能体的运行时底层架构
- 能力门控语言模型:安全性具备组合性,而效用则不然
- 思考模型:授权与能力
证据依赖
证据可视化
证据学习
证据引导
证据感知
证据整合
证据森林
证据溯源
证据盲区
证据缓冲区
证据解释
证据验证
证明助手
评估
评估偏差
评估偏见
评估员敏感性
评估基准
- MameLoshnLM:意第绪语语言模型与评估基准
- 能力不等于倾向:测量公民大模型智能体中抗压协作行为
- 揭示大语言模型中类人表征的计算要素
- ARC-Bench:闭环重规划掩盖了冻结 JEPA 世界模型中失效的动作排序
评估对齐
评估指标
- 排序与分配:多视角目标关联中的指标不匹配问题
- 评估指标能检测出文言文到英文翻译中的错误吗?
- 上下文压缩给AI智能体带来了什么代价?被任务完成指标掩盖的交互成本
- 超越 F1 分数:评估 AI 模型安全扫描器的覆盖率与故障恢复能力
- SVG-Score:与人类偏好对齐的文本生成SVG评估方法
评估方法
评估机制
评估框架
- AI智能体能否进行开放式AI研究?两项案例研究的初步证据
- 交互就绪性:构建与评估人类角色 AI 智能体的框架
- 基于扩展假设在无标签情况下评估智能体学习框架能力
- 超越裁决:基于图结构的科学事实核查中人类与大语言模型推理过程分析
- FIDES:大模型生成交易策略的一致性协议
评分偏差
评分标准
评分标准伪影
评分标准干扰
评分细则
评判偏差
评判器
评判器优化
评判模型
评测偏见
评测基准
- PHASE-Tree:长程角色扮演对话中的角色状态演化建模
- MetaSpace:面向具身智能体空间认知的变形测试框架
- CADEngBench:看起来像CAD,但它真的能用吗?评估参数化设计、装配推理与物理仿真
- RealisticTritonBench:真实世界 AI 框架中 Triton 内核生成的评测基准
- 全能裁判还是全能偏见?通过平衡解耦视角诊断多模态裁判模型
- 相比于谁?大语言模型生成基础设施即代码(IaC)的人类锚定安全基准
- 保持统计严谨性的重要性:对 GSM-Symbolic 的批判性重新评估
- 多模态GUI智能体是否知道何时停止操作?实现具备冲突意识的终止机制
- 关系线性度是大模型幻觉的预测指标
评测框架
评论员模型
诉讼培训
诊断分类法
诊断本体
词元嵌入
词汇扰动
词汇耦合
词汇趋同
词汇频率
词法形态学
词表优化
词表掩码
话轮转换
语义ID
语义依赖
语义分割
语义压缩
语义叠加
语义叠加层
语义对齐
语义嵌入
语义恢复
语义感知微调
语义抽象
语义抽象度
语义推理
语义提升算子
语义搜索
语义攻击
语义数据湖
语义校准
语义检索
语义池化
语义注意力
语义深度评分
语义理解
语义监督
语义空间
语义端点检测
语义纠错
语义缓存
语义编译
语义网
- FITTER:时序知识图谱上与词表无关的跨领域推理
- 从学生风险预测到SC2R:面向教育决策支持的语义约束反事实归因
- FedV-KGQA:基于垂直划分知识图谱的多跳问答框架
- PIE-APT:通过增量推理在时序动态知识图谱上进行 abductive 规划
语义表征
语义解耦
语义调控
语义通信
语义验证
语料库地图
语料库建设
语法数一致性
语法约束
语用信息论
语言一致性
语言偏见
语言公平性
语言学
语言学习
语言学基准
语言扩散模型
语言服务器
语言服务器协议
语言模型
- 点火指数:衡量语言模型中的全局工作空间动力学
- MameLoshnLM:意第绪语语言模型与评估基准
- ELMER:探索与优化的进化语言模型
- 超越结果奖励:面向深度搜索智能体的步级自蒸馏策略优化
- 多智能体语言模型中的道德风险
- 分工协作:将证据解释与决策聚合解耦
- Co-RL:多智能体强化学习中多元群组涌现的无监督推理
- LZ 惩罚:自回归语言模型的一种信息论重复惩罚机制
- 通过形式化抽象提升资源受限语言模型中的自然语言组合优化准确率
- 通过全视界压缩循环实现符号音乐语言模型整曲训练
- 语言模型认为谁更有能力?职业偏见的机械可解释性分析
- VA-DPO:用于语言模型可控情感生成的效价-唤醒度直接偏好优化
- 利用非绑定自条件机制改进少步语言流模型
- ConvergeFlow:具备可证明收敛到词元嵌入能力的语言流模型
- 答前先知:解码语言模型以实现可靠的RAG
- DKL:面向指令微调语言模型的解耦知识学习方法
- 从欺骗性输出到欺骗性机制:语言模型欺骗研究的因果框架
- SV-Detect:利用引导向量进行AI生成文本检测
- 从语言模型嵌入中恢复时间与地理信号
- 早期编码、后期调用:Transformer在何时开始依据推断出的伙伴专业性采取行动
- 连续扩散语言模型在规模化扩展上可媲美离散扩散
语言模型安全
语言模型智能体
语言模型预训练
语言演变
语言生成
语音AI
- 构建低延迟多语言语音智能体:NVIDIA Magpie TTS 带来开源权重与全面部署控制
- DuplexSpeechBench-IFEval:评估全双工语音智能体中的隐式指令遵循能力
- TamilEOT:泰米尔语电话语音中语义轮次结束检测的数据集与模型
语音交互
语音代理
语音分析
语音匿名化
语音基础模型
语音处理
语音大模型
- 语音大模型会听从自己的观点吗?诊断并缓解流式情感理解中的先验信念污染
- FastSLM:用于高效长语音自适应的分层时间抽象架构
- 面向语音大模型服务的可扩展上下文编排
- 超越提示词工程:基于对数几率空间融合的语音大模型高效鲁棒上下文偏置 (LOGIC)
语音情感识别
语音情绪识别
语音智能体
语音检索
语音翻译
语音解码
语音识别
- 通过年龄感知训练实现儿童语音的边缘端音素识别
- 衡量语音识别中的基准过拟合现象
- TurboBias 2.0:面向生产级高效 ASR 系统的流式上下文偏置框架
- 倾听潜变量:通过大音频语言模型中的隐状态交互实现自纠错语音识别
- 匿名化而非消除:保留实用性的语音匿名化
- 通过幻觉空间投影减少 Whisper 模型中的幻觉转录
- 声音去哪儿了?追踪音频条件大语言模型中的声学信息丢失
- 超越提示词工程:基于对数几率空间融合的语音大模型高效鲁棒上下文偏置 (LOGIC)
语音韵律
误差分析
误拒绝
说服力
诺贝尔图灵挑战
课堂教学
课程学习
调度算法
调度系统
调查方法论
调试
谄媚现象
谄媚行为
谎言识别
谱几何
谱分析
谱收敛
贝叶斯优化
贝叶斯学习
贝叶斯实验设计
贝叶斯推断
贝叶斯推理
贝叶斯更新
贝叶斯最优停止
贝叶斯校准
贝叶斯模型
贝叶斯网络
贝叶斯误差
贝塞尔函数
贝尔曼方程
负对数似然
负微分电阻
负电阻
负载均衡
- EasyBalance:分布式 MoE 推理中的跨层负载均衡
- TEMPO:跨内存和计算瓶颈区感知完工时间的专家并行负载均衡
- 大模型推理服务的一年:工作负载演进、缓存与负载均衡
- TEMPO:面向内存与计算受限场景的专家并行负载均衡调度器
- 负载均衡走向极端:过度离散混合专家模型中的专家剪枝专家洞察
- 路由器先验偏置:在 MoE 后训练中保持基础路由结构
负阻现象
负面结果
贡献度评分
责任判定
责任归因
责任归属
质量-多样性
质量多样性搜索
质量感知
质量控制
费雪信息
费雪信息矩阵
费马大定理
资产管理
资源优化
资源估计
资源分配
资源利用
资源发现
资源受限
资源竞争
资源约束
资源调度
资源适配
超低比特
超分辨率
超参数优化
超参数调优
超图空间
超声影像
超现实数
超维计算
超网络
超表面
越南高考
越狱攻击
- 作为攻击目标与对抗者的扩散大语言模型:机理性安全漏洞
- GRM:通过梯度比率掩码对音频大模型实施兼顾效用的越狱攻击
- 多模态大语言模型不断演进的安全格局:新兴威胁与防御综述
- 视觉语言模型中基于方向的推理时防御机制的跨架构审计
- 解码前拒绝:检测与利用大语言模型中间激活中的拒绝信号
- 续写与拒绝的博弈:大语言模型中续写触发型越狱的机制分析
- 重形式轻实质:内容不变的外壳如何颠覆大模型安全评判器的裁决
越狱攻击防护
越狱防御
跨具身机器人
跨受试者泛化
跨域存储
跨域推荐
跨域迁移
跨数据集解码
跨架构审计
跨模型迁移
跨模态学习
跨模态安全漂移
跨模态对齐
跨模态查询
跨模态检索
跨模态泛化
跨粒度对齐
跨维度泛化
跨视角地理定位
跨语境一致性
跨语言推理
跨语言评估
跨语言迁移
跨进程架构
跨领域推荐
跨领域泛化
跨领域迁移
路径积分
路径表示学习
路径规划
路径规划算法
路由协议
路由器先验偏置
路由层
路由机制
身份识别
身份验证
车路协同
车辆路径问题
车辆重路由
轨迹优化
轨迹分析
轨迹审查
轨迹审计
轨迹感知
轨迹投毒
轨迹提示
轨迹管理
轨迹级干预
轨迹规划
轨迹重建
轨迹预测
轨迹风险
轨道AI
轨道倾角
转写忠实度
转化率
软件供应链
软件安全
软件工程
- 面向编码智能体的全局可重用技能学习
- 基于大语言模型的智能体化软件缺陷修复:综述
- RepoProbe:使用检查表评估架构感知的代码库理解能力
- 编程智能体的在线监控与纠偏导向
- PACE:用于自动化算法设计的原语感知代码演进
- OpenTelemetry 进展受阻:一场关于稳定性、规模与维护者的危机
- 影响力策略重要吗?大语言模型代码生成中提示词框架效应的研究
- RealisticTritonBench:真实世界 AI 框架中 Triton 内核生成的评测基准
- CLAUDE.md 为什么会不断膨胀?智能体编程中的“灾难性记忆”现象
- Comprendia:AI 增强的代码理解工具
- 个性化技能能帮助编程智能体吗?开发者交互历史的实证研究
- Vero:AI智能体能够构建形式化验证的软件代码库吗?
- 衡量语言模型智能体中的跨任务行为一致性
- 工程化可靠的编程智能体:评估与运维模型周边的系统
- 从代码评审到代码批判:大规模 AI 生成差异的意图、偏移与聚光灯机制
- Kozuchi Agent:用于软件修复的语言无关开源权重智能体
- 迈向无风险的AI智能体部署
- TRUSS:迈向任务可靠与用户安全的自动化智能体技能生成
- 聚合评分的盲区:衡量商业大模型API迁移中的项目级性能退化
- FVSpec:将现实世界的基于属性的测试转化为 Lean 挑战
- 仓库中的问题追踪:探索去中心化基于 Git 的问题追踪系统
- 是什么让软件问题解决任务对智能体来说如此困难?
- SkillForge:面向特定项目问题解决的自我蒸馏智能体
- 解码 AI:智能体循环架构与供应商经济学
- 我的 agent.md:如何利用它提升大模型辅助编程的代码质量
- 终端智能体:命令行环境下的 AI 智能体综述
- 真实软件历史中的时间有效性:基于GitHub修复消除代码助手记忆中的陈旧事实错误
- BC-Bench:评估面向 ERP 领域特定语言的智能体工程能力
- PatchWrite:一行而非一节——面向AI撰写文稿的编译门控与有效性保持编辑框架
- 架构作为代码Agent的能力均衡器
- AgentRoom:基于CRDT共享工作空间的并发多智能体编程
- 适得其反的反馈:为什么小型语言模型智能体总是重复刚目睹失败的函数调用
- 分久必合:三大 LLM Agent 框架的架构趋同
- 面向人类与机器代理的文学化编程环境
- DSA:面向多市场股票研究的证据感知型大模型智能体编排框架
- 使用编码智能体进行自动研究:古兰经诵读数据上的泛化者与指标最大化者
- DSA:面向多市场股票研究的证据感知大模型智能体编排框架
- 角色与执行分离:在执行审计下演进LLM智能体的架构模式
- SWE-Prime:更少的轨迹,更优的性能
- 使用编码智能体进行自动研究:古兰经朗读数据上的泛化者与指标最大化者
- RealSWE:真实用户请求下编码智能体的组合式评估
- 相比于谁?大语言模型生成基础设施即代码(IaC)的人类锚定安全基准
- 智能体插件的维护与共演化:Claude Code 插件市场的实证研究
- SpecMine:大规模规范驱动开发(SDD)工件语料库
- Harness-of-Harness:实现具备持续改进能力的多天自主软件开发
- 运行时独立的持久化智能体:跨模型、框架与服务器保持身份、记忆和代码的连续性
- CordisBench:语言模型能否在动态智能体运行框架中进行组件生命周期推理?
- 我们该多大程度上信任开源数据?
- ExecRetrieval:衡量代码嵌入检索中的功能正确性差距
- 当模型改动过多:论最小代码编辑的保真度
- FVSpec:将现实世界基于属性的测试转化为 Lean 挑战
- 差异补丁 vs. 整体文件:Flutter/Dart 代码模型迭代编辑式与直接生成式的实证比较
- CodeTD:注意力拓扑结构检测代码大语言模型中的幻觉
- Ecdysis:面向大模型智能体运行时脚手架的高效进化训练
- 如何精准捕获代码缺陷:基于 Rust 正则引擎的高效模糊测试实战
软件工程智能体
软件开发
- 使用 Supabase Edge Functions 和 mcp-use 构建 ChatGPT 应用
- 潜在的力量:AI时代黑客技术的趋同与独立思考的反思
- AI编程助手在安装前会进行安全检查吗?针对研究软件供应链中信任信号的预注册需求侧审计
软件架构
软件框架
软件测试
软件逆向
软体机器人
软撤销机制
轻量化模型
轻量化网络
辐射场
辩证协议
边缘AI
- 面向小型设备的超大模型:边缘AI部署的近期进展与实证分析
- MotoSafety:利用学习型时间重要性在时间压力下进行两轮车碰撞风险评估的边缘AI
- 面向持久化机器监测的低功耗神经形态声学异常检测
- 你的边缘设备是以单次前向传递进行基准测试的,但你的Agent将运行循环
- 乳腺癌多学科团队会议边缘AI医疗器械系统的开发与可行性评估
- 大语言模型中的量化触发式后门:跨量化器可迁移性与验证-部署鸿沟
边缘安全
边缘案例
边缘计算
- 一图胜千Token:视觉语言模型如何在大幅降低AI能耗的同时提升准确率
- TransSLR:用于手语识别的轻量级 Transformer
- Data API 路由至最近的只读副本
- Supabase Edge Functions 重磅更新:引入后台任务、临时存储与 WebSocket 支持
- APEX:面向内存高效的边缘端 MoE 推理的自适应专家预取技术
- 通过年龄感知训练实现儿童语音的边缘端音素识别
- MemSpec:面向边缘设备推测解码自适应草稿调度的内存感知运行时
- 通过SLM与边缘计算增强虚拟智能体:思考与记忆过程的探索性评估
- DomusFM:用于智能家居基于事件行为监测的基础模型
- Transformer 需要三个投影吗?QKV 变体的系统性研究
- 面向高能效深度神经网络推理的内存与计算频率联合优化
- OTIS:使用微型编码器学习高质量时间序列特征
- 轨道AI计算:不同卫星规模下的碳排放权衡
- Wiola 13M:面向参数高效小型语言模型的门控螺旋注意力架构
- 人工智能作为打击童工的工具:用于儿童检测与年龄估计的实时边缘视觉流水线
- 基于量化感知蒸馏的 LFM2.5 Q4_0 检查点发布
- 异构边缘-云连续统中的自适应人工智能任务划分与安全卸载
- S2-MoE:在边缘设备上实现高效的混合专家模型自推测解码
- 基于边缘计算的代理式检索增强生成技术:用于联邦公路管理局(FHWA)桥梁检测合规性
- 用于家禽养殖福利约束控制的混合边缘云数字孪生系统
- 小型推理模型在函数调用中即为指令遵循者
- TinyML 系统的功耗与性能特性分析
- LiteEvent-AE:面向低延迟、受限能耗边缘设备的事件相机轻量级自编码器
- ORBITALIF:一种用于星载去云的高效脉冲联邦学习框架
- ST-Lite:面向长程 GUI 智能体的免训练空间轨迹引导 KV Cache 压缩框架
- 自信地出错且悄无声息:对已部署端侧语言模型不可检测故障的审计
- CollaFuse:协作式扩散模型
- AirLLM:基于扩散策略的自适应 LoRA,用于大语言模型的无线远程微调
- 基于边缘端YOLO与RT-DETR的深度感知路面坑洼检测
- 智能边缘计算
- 当量化破坏记忆:低精度时间序列推理中的循环状态回写机制
- 基于未纠正几何畸变影像的卫星机载甲烷检测技术
边际价值估计
迁移学习
过参数化
过平滑
过度自信
过拟合
过挤压
过程奖励
运动控制
运动程序
运筹优化
运筹学
运算放大器
运维
运维实践
运行壳演化
运行时
运行时可观测性
运行时契约
运行时安全
运行时干预
运行时架构
运行时治理
运行时独立
运行时监控
运行时系统
运行时脚手架
运行时验证
运费估算
近似最近邻搜索
近知价值迭代
进化优化
进化框架
进化策略
进化算法
进化计算
进程内存
进程级分析
连分数
连接池
连续度量场
连续扩散
连续扩散模型
连续批处理
连续控制
连续流
连续环境
连续空间推理
连贯性审计
迭代检测与译码
迷你机架
迷失在中间效应
追踪图
追踪模型
适应度地形
逆事实遗憾最小化
逆动力学
逆合成分析
逆合成预测
逆向工程
- 智能体网络安全的下一个挑战:一个现实且无污染的逆向工程基准
- 训练强化学习模型玩转 Bonk.io
- 使用 Claude 修复 eMachines EL1200 主板 BIOS 漏洞
- 潜在的力量:AI时代黑客技术的趋同与独立思考的反思
- 重新编译远远不够:测试引导的反编译C代码修复
逆向技术
逆向设计
逆问题
透明度惩罚
逐层分析
递归合成
递归多项式
递归形状
递归推理
递归架构
递归树搜索
递归混合模型
递归生成
递归自我提升
递归自我改进
递归训练
通信优化
通感一体化
通用语假设
通用近似
通用近似定理
通配符推理
逻辑学
- 罗马诺夫三元组逻辑的形式化验证:用于滑动窗口3-CNF的验证过滤器及其在结构化公式中的应用
- 罗马诺夫三元组逻辑的形式化验证:用于滑动窗口3-CNF的经验证过滤器及其在结构化公式中的应用
- HOL 中的一元二阶逻辑:深层与浅层嵌入及自动化忠实性(扩展预印本)
逻辑嵌入
逻辑张量网络
逻辑推理
- 观点:是时候优化大语言模型的自洽性了
- 深思熟虑,一语中的:ReLIT,一种递归潜在隐式 Transformer 框架
- 长 SKILL 合规性作为逻辑推理:基于闭包扎根检测与缩放引导的策略内蒸馏
- 言语过度自信的不同面相:一项可解释性研究
- 漫步黑暗面:使用 DARKSIDE 进行逻辑增强生成与连贯性审计
- 对比分支策略优化 (CBPO)
- 引入非基项子句学习拓展 SMT 求解能力
逻辑综合
逻辑表征编辑
道德基础理论
道德对齐
道德推理
道德风险
道路养护
遗传算法
遥感
遥感图像分割
遥感影像
遥感监测
遥测技术
邮件解析
部分可观测性
配方数据
配置即代码
采样优化
采样偏差
采样效率
采样机制
采样策略
采样算法
采样调度
重复不匹配
重复启动效应
重复循环
重复惩罚
重心有理插值
重排器
重排模型
重整化
野火扑救
量化
- 将 Nunchaku 4-bit 扩散推理引入 Diffusers
- 在原生 FP4 硬件上使用 MXFP4 预训练大语言模型
- 量化智能体剖析:代码合成智能体工作负载中的显存稳定性与预测
- 面向小型设备的超大模型:边缘AI部署的近期进展与实证分析
- 停止全精度索引:重新审视向量嵌入的聚类方法
- 熵约束自适应随机量化
- 量化感知修复(QAH):一种超越全精度原型的压缩4比特模型
- Minima-KV:采用混合格式分页注意力的保持保留型 KV 缓存压缩技术
- 压缩三位一体:探索大语言模型压缩的稀疏性、量化与低秩近似
- 频率至关重要:用于剪枝与量化的快速模型无关数据筛选方法
- 压缩驾驶策略中能力损失与恢复的闭环评估
- OCGQuant:面向 NVFP4 量化的异常值伴随分组法
- Qwen3-4B 后训练三值化:能力、有效比特预算、存储压缩与部署
- 面向长上下文大模型解码中密集片上NVM的接口感知KV缓存量化
- 全为了1比特:迈向大语言模型真正的1比特训练后量化
量化交易
量化感知蒸馏
量化技术
量化金融
量子传感
量子复杂性
量子多体物理
量子干涉
量子拔河模型
量子机器学习
量子物理
量子电路
量子电路优化
量子算法
量子计算
- InferQ:面向量子电路模拟的数据库基准测试
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- 一个 12-CNOT 的双量子比特激发门
- 镜前单原子:一种通用储备池计算机
- 12-CNOT 双量子比特激发门
- Hamilton-Zero:用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
- 12个CNOT的双量子比特激发门
- 基于二元决策图的大模型驱动量子电路综合算法设计
- Qlippy:一个用于可复现量子工作流与实验追踪的检索增强型生成式AI助手
- 量子AI会梦见路径吗?基于Grover干涉的路径积分慢思考
量子认知
量子门分解
金融AI
- AQuA:递归自我提升的量化交易研究智能体
- 多智能体金融顾问中的检索增强生成与确定性税务计算:一项 2x2 析因实验
- VERA-8B:基于SEC备案文件的证据溯源审计风险推理模型
- FinalityBench:评估智能体在延迟与冲突金融终局性下决策的效果级基准
- GoAnt:基于质量-多样性多智能体搜索的市场微观结构数据Alpha因子挖掘
金融交易
金融分析
金融大模型
金融数值推理
金融数学
金融时间序列
金融智能体
金融机器学习
金融科技
- 新兴的零售投资组合管理应用:基于自然语言目标的个性化、税收意识强化学习
- 开源权重模型在金融文本理解领域能否与闭源模型一较高下?
- DSA:面向多市场股票研究的证据感知型大模型智能体编排框架
- DSA:面向多市场股票研究的证据感知大模型智能体编排框架
金融问答
金融预测
铁电材料
铁路晚点预测
链式思维
链式思考
链接预测
链路追踪
错位行为
错误传播
错误分析
错误注入
错误管理
锚定偏差
锦标赛奖励
键值缓存
长上下文
- LongGuard:安全护栏长上下文失效的机理分析与免训练缓解策略
- 面向上下文密集型任务的 KV 缓存卸载技术
- HeadWiseKV:混合长上下文语言模型的按头预算化缓存驻留机制
- HISA:面向细粒度稀疏注意力的高效分层索引机制
长周期智能体
长尾延迟
长度泛化
长度预测
长效记忆
长文本
长文本处理
- 抛弃锚点:通过 Pulsar Attention 实现分布式系统的统计上下文摘要
- 迷失在压缩中:评估上下文压缩下的侧面约束丢失
- BF1:面向高效长文本 Transformer 的因果二元稀疏注意力改造方案
- LongGuard:安全护栏长文本失效的机理分析与免训练缓解方案
长文本大模型
长文本大语言模型
长文本推理
长文本生成
长文本解码
长文档推理
长时序推理
长时序预测
长期任务规划
长期内存
长期记忆
- 使用 Postgres 构建个性化 AI 助手
- EgoMonth:用于长期时空记忆的月度级第一人称视频基准
- 通过建议渠道实现的个人赋权剥夺:内生影响力下的控制权丧失
- 重要他人 AI:作为长期关系智能的身份、记忆与情绪调节
- HERO:用于长程智能体记忆的人类画像增强检索优化框架
- 记忆究竟何时有用?工具调用大语言模型智能体中长期记忆的成本感知评估
长期记忆管理
长短期记忆
长程任务
- AtomBridge:面向科学实验长程任务的智能体化 VLA 推理插件
- 面向工具使用型大模型智能体的完全循环子任务图:长程工作流中的灵活性、成本与瓶颈
- 上下文即环境:面向长程智能体的程序化上下文管理
- T1:面向长程终端任务的强化学习智能体
长程推理
长程智能体
长程科研
长视界任务
长视角智能体
长视野推理
长视频问答
门控DeltaNet
门控机制
闭源模型适配
闭环优化
闭环研究
闭环评估
问答系统
问题生成
问题追踪
间接提示词注入
间谍神话
间隔重复
阅读时间预测
队列
防作弊
防御训练
防御集成
阶乘
阿克曼转向
阿尔茨海默病
阿拉伯音乐
降低成本
降偏机制
降维
降维可视化
限价订单薄
院前急救
随机动力系统
随机博弈
随机强迫
随机性
随机最短路径
随机梯度下降
随机森林
随机特征方法
随机矩阵理论
随机配置机
隐写术
隐含波动率
隐喻解释
隐式 Transformer
隐式个性化
隐式推理
隐式通信
隐式需求估计器
隐状态
隐状态交互
隐状态探测
隐状态通信
隐私与公平
隐私保护
- 通过零知识证明实现图像溯源的软修订
- LSEAD:一种基于大语言模型的隐私保护语音分析框架,用于阿尔茨海默病早期筛查
- 通过向外部大语言模型隐匿敏感信息实现保护隐私的检索增强生成(RAG)
- CutClean:面向隐私保护推理的神经网络剪枝方法
- LUNAR:基于通用用户行为日志的个性化大语言模型基准测试
- Bluesky 和 Threads 是如何在 iOS 截图里偷偷塞入自家 Logo 的
- 通过注意力头干预实现大语言模型中的个性化隐私控制
- RoboShape:面向隐私感知机器人感知的基于信息论的点云表征
- 遗忘不等于简单擦除:基于生成不等式的时序解耦
- MOSAIC:安全 AI 计算的掩码外包方案
- 从信息流视角看可解释性需求:规范与验证
- CollaFuse:协作式扩散模型
- 不为破坏,而为证明:用于保护隐私的大模型验证之对抗性探针
- PrivateHub:用于私密传感器密集型环境数据生成的对比扩散模型
- 基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全性
- 匿名化而非消除:保留实用性的语音匿名化
- 反词元化泄漏:从缓存痕迹重建本地大模型输出
隐私安全
隐私泄露
隐私计算
隐空间
隐空间思维
隐空间诊断
隐蔽通信
隐藏信息
隐藏状态
隐藏状态优化
隐藏状态投毒
隐马尔可夫模型
难度感知
难负样本挖掘
雅可比透镜
集体动力学
集体行为
集合函数
集合预报
集成光子学
零售供应链
零样本学习
零样本泛化
零样本迁移
零样本迁移学习
零知识证明
- 零知识证明浅析
- NiyamAI:一个基于零知识证明构建、具备密码学可验证护栏的意图绑定型AI智能体
- 通过零知识证明实现图像溯源的软修订
- 前沿人工智能训练的零知识验证是可行的
- NiyamAI:基于零知识证明的具备密码学可验证护栏的意图绑定型AI智能体
雷达点云生成
需求响应
需求预测
静态分析
- SkillConsist:通过双向图对齐检测智能体技能中的不一致性
- 基于静态分析引导的智能体 AI 翻译:使 Rust 成为全栈生物信息学语言
- 微调 Qwen3-27B 实现 C 到 Rust 代码转换:包含预训练、调试感知 SFT 与特定任务 SFT 的三阶段课程
- 使用大语言模型在智能合约中进行自动化漏洞注入
- 历史即检测器:端到端执行CVE补丁历史
非凸优化
非易失性内存
非欧几里得几何
非独立同分布
非结构网格
非言语行为
非高斯性
音乐信息检索
音乐创作
音乐生成
音乐结构规划
音素识别
音素驱动
音视频多模态
音视频生成
音频分类
音频压缩
音频基础
音频增强
音频处理
音频大模型
音频生成
音频语言模型
音频转乐谱
音频驱动人脸
音高控制
顶点覆盖
项目反应理论
顾问AI
预处理不变性
预注册审计
预注册研究
预注册评估
预测与健康管理
预测信号
预测加工
预测增强
预测崩溃
预测性流程挖掘
预测性维护
预测性记忆定位
预测模型
预测编码
预算优化
预算分配
预算感知搜索
预训练
- 训练混合:将小规模支架式预训练运行重新组合为更大的语言模型
- 合成角色预训练:从第零个Token开始的对齐
- LLM预训练中领域数据重复策略的扩展规律
- ADEPT:通过强化学习的预训练与后训练加速机器人灵巧操作
- DKL:面向指令微调语言模型的解耦知识学习方法
- 小型Transformer中用于对比代码表示学习的合成语义监督:一项实证研究
- 拒绝的几何学:为什么事后安全机制如此脆弱,而预训练阶段的安全机制能够持久
预训练数据
预训练模型
领域数据
领域特定LLM
领域特定语言
频域分析
颜色处理
风格迁移
风险分类法
风险感知
风险推理
风险管理
- 运行时压缩风险定价:压缩服务状态的随时有效准入与服务输出定律
- 迈向无风险的AI智能体部署
- FraudBench:金融风险评估中对抗鲁棒性的协议敏感型基准测试
- 自由派生,审慎行动:递归大模型智能体树的渐进风险归属机制
风险评估
飞行数据分析
飞行预测
香农信息论
马尔可夫决策过程
马尔可夫奖励
马尔可夫链
马尔可夫链蒙特卡洛
驱动修复
验证信号
验证器
验证器监督
验证器门控
验证套件
验证技术
验证搜索
验证机制
骨关节炎
骨科诊断
高光谱成像
高可用
高层次综合
高性能代理
高性能计算
高效推理
高斯混合模型
高斯溅射
高斯过程
高通量筛选
高速公路监控
鱼类新鲜度
鲁棒优化
鲁棒性
- 措辞效应:量化大语言模型基准测试中的双向漂移
- 合成角色预训练:从第零个Token开始的对齐
- 状态条件验证:用于适配与监控安全分类器的正确性估计
- 见红则思恶:视觉语言模型中的色彩偏见
- 提升多模态 RLVR 的泛化鲁棒性
- 基于物理基础的端到端驾驶规划器因果审计
- 不完美对齐下的价值脆弱性
- 何时将苹果称为红色:人类遵循内省规则,而视觉语言模型(VLM)则不然
- ER-KANs:面向数据稀缺科学机器学习的高效且鲁棒的柯尔莫哥洛夫-阿诺德网络
- 抓住关键时机:诊断与提升视动模仿策略中的条件视觉基础定位