文章背景与核心概要
本文由 Magami 开放科学倡议组织的研究人员撰写,旨在探讨大语言模型(LLM)在抗疟药物虚拟筛选(VS)中的应用潜力。研究团队构建了名为 Malaria-Instruct 的指令微调数据集,该数据集源自 ChEMBL Legacy Malaria 语料库,专门用于评估模型在复杂化学空间下的预测能力。
研究通过严谨的分布外(OOD)少样本测试,对比了五种开源 LLM(Gemma-2、TxGemma、LlaSMol-Mistral)与传统机器学习模型(随机森林、XGBoost)以及前沿闭源模型(Gemini 2.5、OpenAI o3)的性能表现。结果表明,领域特定的微调对于提升模型在药物发现任务中的表现至关重要,微调后的开源模型在 ROC-AUC 和富集因子(EF)指标上均显著优于未经微调的前沿模型及传统基准。
疟疾药物发现中大型语言模型的严谨评估:性能、规模与资源效用的权衡
摘要
This paper, authored by researchers from the Magami Open Sciences Initiative, introduces Malaria-Instruct—a curated instruction-following dataset derived from the ChEMBL Legacy Malaria corpus designed for virtual screening (VS). The study evaluates five open-source Large Language Models (LLMs) (Gemma-2 2B/9B, TxGemma-2B/9B, and LlaSMol-Mistral-7B) against classical machine learning models (Random Forest, XGBoost) and frontier proprietary models (Gemini 2.5, OpenAI o3) under a rigorous out-of-distribution few-shot data split.
The findings demonstrate that domain-specific fine-tuning is vital: fine-tuned open-source LLMs substantially outperform classical baselines and unprompted frontier reasoning models (such as Gemini 2.5 and OpenAI o3). Among them, TxGemma-9B achieved the highest ROC-AUC (\(0.731 \pm 0.005\)), while LlaSMol-Mistral-7B attained the best enrichment factor (EF@1\% \(\approx\) 4.99). Ultimately, fine-tuned open-source LLMs provide a robust, resource-efficient paradigm for antimalarial drug discovery under structurally challenging conditions.
本文介绍了 Malaria-Instruct,这是一个从 ChEMBL Legacy Malaria 语料库中提取的、用于疟疾虚拟筛选的精选指令遵循数据集。我们对五种开源 LLM(Gemma-2 2B/9B、TxGemma-2B/9B 和 LlaSMol-Mistral-7B)在严谨的分布外数据划分下进行了系统评估。在少样本条件下,我们将模型性能与传统机器学习模型(随机森林、XGBoost)及前沿闭源模型(Gemini 2.5、OpenAI o3)进行了基准对比。微调后的 LLM 显著优于所有基准模型:TxGemma-9B 实现了最高的 ROC-AUC (\(0.731 \pm 0.005\)),而 LlaSMol-Mistral-7B 获得了最佳的富集因子 (EF@1\% \(\approx\) 4.99)。事实证明,领域特定的微调是绝对不可或缺的,在最佳少样本条件下,TxGemma-9B 的 ROC-AUC 从 0.731 下降至 0.499,且 Gemini 2.5 (ROC-AUC \(\approx\) 0.53) 和 o3 (ROC-AUC \(\approx\) 0.59) 在未经微调的情况下均未能实现可靠的判别。生物医学预训练在同等规模下带来了可衡量的优势,而化学感知预训练则产生了更优的预期富集效果。微调后的开源 LLM 代表了一种极具吸引力且资源高效的抗疟疾虚拟筛选范式,在结构复杂的条件下,其表现优于传统流程和闭源推理模型。
We introduce Malaria-Instruct, a curated instruction-following dataset derived from the ChEMBL Legacy Malaria corpus for Malaria virtual screening, and conduct a systematic evaluation of five open-source LLMs; Gemma-2 2B/9B, TxGemma-2B/9B, and LlaSMol-Mistral-7B, on a rigorous out-of-distribution data split. Performance was benchmarked against classical ML models (Random Forest, XGBoost) and frontier proprietary models (Gemini 2.5, OpenAI o3) under few-shot conditions. Fine-tuned LLMs substantially outperformed all baselines: TxGemma-9B achieved the highest ROC-AUC (\(0.731 \pm 0.005\)) and LlaSMol-Mistral-7B the best enrichment factor (EF@1\% \(\approx\) 4.99). Domain-specific fine-tuning proved categorically indispensable with TxGemma-9B collapsing from ROC-AUC 0.731 to 0.499, under its best few-shot condition, and neither Gemini 2.5 (ROC-AUC \(\approx\) 0.53) nor o3 (ROC-AUC \(\approx\) 0.59) achieved reliable discrimination without fine-tuning. Biomedical pretraining conferred a measurable advantage at equivalent scale, while chemistry-aware pretraining yielded superior prospective enrichment. Fine-tuned open-source LLMs represent a compelling, resource-efficient paradigm for antimalarial VS, outperforming both classical pipelines and proprietary reasoning models under structurally challenging conditions.
文章详情
- arXiv 标识符: arXiv:2608.20418 [q-bio.QM]
- 发布日期: 2026年8月18日
- 主要学科: 定量方法 (
q-bio.QM) - 次要学科: 人工智能 (
cs.AI),机器学习 (cs.LG) - 作者:
- Marvellous O. Ajala (Magami Open Sciences Initiative)
- Zainab Ashimiyu-Abdusalam (Magami Open Sciences Initiative)
- Comfort Adesina (Magami Open Sciences Initiative)
访问与资源
- 全文链接: 查看 PDF | HTML 版本 (实验性) | TeX 源码
- 许可协议: 知识共享署名 4.0 国际许可协议

- 外部引用: Google Scholar | Semantic Scholar | NASA ADS