建立基准测试平台
实现可重复、可控的LLM评估,支持多种模型和任务。
开发了浏览器访问的自动评估框架,通过OpenRouter API统一访问多个LLM,采用确定性解码(温度0),使用机器可读的输出模式和验证模板,并记录所有请求和结果。
Comparative assessment of large language models for microbial phenotype assignment
研究包含多层级验证:对57个模型进行幻觉率评估(200个人工名称)、对22个模型进行知识校准一致性分析(3884个物种)、对31个模型进行10项表型分配准确性测试(3876个物种),并通过系统验证确认新分配的正确性(45个样本手工核查)。
57个大型语言模型(包括GPT、Claude、Gemini、DeepSeek、Llama等) 3884个物种的WA基准数据集 15256个物种的LA基准数据集 200个人工合成名称(用于幻觉评估)
模型版本和访问方式(通过OpenRouter API,温度设为0) 用于知识水平自评的提示模板(模板1-3) 表型分配提示模板(强制选择,不允许N/A) 人工合成名称的类别和数量(4类,每类50个) 用于验证的数据集(WA和LA)
提炼研究问题、关键发现与证据,快速把握文章的核心贡献。
按研究推进顺序梳理实验设计、验证步骤与关键观察。
实现可重复、可控的LLM评估,支持多种模型和任务。
开发了浏览器访问的自动评估框架,通过OpenRouter API统一访问多个LLM,采用确定性解码(温度0),使用机器可读的输出模式和验证模板,并记录所有请求和结果。
检测模型对不存在的物种名称是否会产生幻觉性回答。
生成200个人工合成物种名称(分4类:英语词对、拉丁语发明、真实属+发明种加词、发明属+真实种加词),用知识水平提示模板3(允许回答NA)对所有57个模型进行查询,计算模型正确拒绝(NA)与幻觉(给出任何知识水平)的比例。
评估LLM自评知识水平与真实信息可用性的关联,并量化模型间的一致性。
使用WA数据集(3884种物种),对22个LLM应用知识水平提示模板3,获得每个模型的知识水平分配,计算Shannon熵衡量模型间不确定性,并与Google搜索计数(网络信息可用性代理)进行Spearman相关分析。
评估LLM在10项微生物表型上的分配准确性,并分析影响性能的因素。
在WA数据集(3876种有标签的物种)上,使用强制选择的表型提示对31个LLM进行查询,计算每个模型-表型对的平衡准确率,并分析模型大小、发布日期、来源类型等与准确性的关系。
利用自评知识水平过滤提高准确性,并为缺失数据生成新分配。
对于每个表型,在WA数据集上识别最佳表现模型,并仅在高置信度(知识水平为'Extensive')的物种上应用,生成295个新分配;在LA数据集(15256种)上使用grok-3-mini,仅保留自评为'Extensive'且LA缺失的分配,生成1382个新分配。
按研究目的归类文中使用的方法,便于定位所需技术。
| 实验环节 | 名称 | 品牌 | 货号 |
|---|---|---|---|
| 管理推理仪表板 | Flask | 未明确说明 | -- |
| Socket.IO | 未明确说明 | -- | |
| 推理执行 | OpenRouter API | OpenRouter | -- |
| 数据存储 | SQLite | 未明确说明 | -- |
汇总复现实验时建议重点确认的条件及原文阅读提示。
| 环节 | 核对要点 |
|---|---|
| LLM推理设置 | 模型名称、API提供商、温度设置 阅读提示:Methods-Online platform |
| 幻觉评估 | 人工名称列表、知识水平提示模板、模型数量 阅读提示:Methods-Synthetic calibration benchmark |
| 知识校准分析 | WA数据集、模板选择、参与模型 阅读提示:Methods-Knowledge calibration on real species |
| 表型分配评估 | WA数据集、表型提示、模型数量、平衡准确率计算 阅读提示:Methods-Phenotype benchmark |