文章背景与核心概要
多语言信息检索(MLIR)旨在解决现实世界中查询和相关文档可能处于不同语言的复杂检索场景。然而,传统的嵌入模型大多针对单语言环境进行了优化,直接在多语言设置中应用常规对比学习往往会导致语言聚类现象,并在跨语言对齐与嵌入空间均匀性之间产生难以调和的权衡矛盾,从而限制了检索性能。
为了克服这些技术瓶颈,本文提出了 MIMO(基于单语目标的多语言信息检索)两阶段框架。该框架巧妙地利用高性能教师模型的稳定英语语义空间作为锚点:首先通过知识蒸馏初始化学生模型的跨语言对齐,随后联合优化知识蒸馏与跨语言对比学习,在保持跨语言对齐的同时显著增强检索区分度。
大量的实验结果表明,MIMO 在各项 MLIR 和多语言基准测试中均持续超越现有的基线模型,并且在与参数规模相近或更大的现成模型对比中展现出了极强的竞争力。此外,论文中的跨语言对齐-均匀性分析进一步明确了两个损失组件各自的关键作用,证明了它们的组合能够实现对齐与均匀性之间的最优权衡。
MIMO: Multilingual Information Retrieval via Monolingual Objectives
📋 Summary
MIMO (Multilingual Information Retrieval via Monolingual Objectives) is a novel two-stage framework designed to improve Multilingual Information Retrieval (MLIR). While traditional embedding models are primarily optimized for single-language settings, applying conventional contrastive learning to MLIR often leads to language clustering and compromises the balance between cross-lingual alignment and embedding uniformity.
To overcome these hurdles, MIMO uses a stable English semantic space from a high-performing teacher model as an anchor: 1. Stage 1: Initializes the student model’s cross-lingual alignment via knowledge distillation. 2. Stage 2: Jointly optimizes knowledge distillation and cross-lingual contrastive learning to enhance retrieval discrimination while maintaining alignment.
Extensive experiments show that MIMO consistently outperforms existing baselines across diverse MLIR and multi-monolingual benchmarks, performing competitively against off-the-shelf models of similar or larger parameter scales.
📌 Document Metadata
| Metadata Field | Details |
|---|---|
| arXiv ID | arXiv:2605.31171 [cs.IR] |
| Authors | Youngjoon Jang, Seongtae Hong, Heuiseok Lim |
| Primary Subject | Information Retrieval (cs.IR) |
| Secondary Subject | Artificial Intelligence (cs.AI) |
| Conference Venue | EMNLP 2026 Main |
| Submission Dates | Submitted on 29 May 2026; Last revised on 27 Aug 2026 (v2) |
| License / Resources | View PDF |
📄 Abstract
多语言信息检索(MLIR)反映了现实世界的搜索环境,其中查询和相关文档可能出现在混合语言语料库中的不同语言中。然而,现有的嵌入模型主要针对多单语(Multi-Monolingual)检索进行优化,其性能在 MLIR 设置中往往会下降。此外,将传统的对比学习直接应用于 MLIR 可能会加剧语言聚类,并暴露出跨语言对齐与嵌入均匀性之间的权衡问题。
Multilingual Information Retrieval (MLIR) reflects real-world search environments in which queries and relevant documents may appear in different languages within a mixed-language corpus. However, existing embedding models are primarily optimized for Multi-Monolingual retrieval and their performance often degrades in MLIR settings. Moreover, directly applying conventional contrastive learning to MLIR can exacerbate language clustering and expose a trade-off between cross-lingual alignment and embedding uniformity.
为了解决这些局限性,我们提出了 MIMO,这是一个两阶段框架,它使用来自高性能教师模型的稳定英语语义空间作为锚点。MIMO 首先通过知识蒸馏初始化学生模型的跨语言对齐,然后联合优化蒸馏和跨语言对比学习,以提高检索区分度,同时保持对齐。
To address these limitations, we propose MIMO, a two-stage framework that uses a stable English semantic space from a high-performing teacher model as an anchor. MIMO first initializes the student model's cross-lingual alignment through knowledge distillation, and then jointly optimizes distillation and cross-lingual contrastive learning to improve retrieval discrimination while preserving alignment.
广泛的实验表明,MIMO 在各种 MLIR 和多单语基准测试中始终优于现有的跨语言训练基线。MIMO 在参数规模相似或更大的现成模型中也保持了竞争力。此外,我们的跨语言对齐-均匀性分析阐明了两个损失分量的独特作用,并表明它们的组合产生了对齐和均匀性之间的有利权衡。
Extensive experiments show that MIMO consistently outperforms existing cross-lingual training baselines across various MLIR and Multi-Monolingual benchmarks. MIMO also remains competitive with off-the-shelf models of similar or larger parameter scales. Furthermore, our cross-lingual Alignment-Uniformity analysis clarifies the distinct roles of the two loss components and shows that their combination yields a favorable trade-off between alignment and uniformity.
🔗 Related Links & Tools
- Full-Text Options: PDF | HTML (Experimental) | TeX Source
- Citation Tools: NASA ADS | Google Scholar | Semantic Scholar