跳转到主内容
极星编程网:以代码为星,赴技术山海!

ShareGPT在LLM排行榜评测中的数据贡献:公开对话数据对模型排名的影响

ShareGPT显著提升开源模型评测排名:一、作为SFT核心数据源,推动OpenChat等模型在AlpacaEval等榜单登顶;二、其提问与回复结构被用于构建评测提示,导致隐性偏置;三、广泛传播引发数据污染,破坏评估公平性;四、格式标准化降低评测适配门槛,加剧同质化竞争。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜如果您在查阅LLM排行榜(如AlpacaEval、MT-bench或OpenCompass)时发现某些开源模型表现异常优异,其背后很可能直接关联到ShareGPT数据集的使用情况。以下是揭示该数据集如何实质性影响模型评测排名的关键路径:

一、ShareGPT作为SFT微调核心数据源驱动排名跃升

ShareGPT提供的约9万条高质量、多轮、真实用户与GPT系列模型交互的对话,已成为监督微调(SFT)阶段最主流的公开数据来源。其天然具备的上下文连贯性与真实指令分布,使微调后的模型在人类偏好对齐任务中获得显著优势,从而在以人类反馈为基准的排行榜(如AlpacaEval)中得分更高。

1、研究团队从ShareGPT原始数据集中筛选出约6K条由GPT-4生成的高质量对话,用于微调OpenChat模型;

2、该微调策略使OpenChat在AlpacaEval上取得80.9%胜率,登顶当时开源模型榜首;

3、同一批ShareGPT子集亦被用于训练OpenChat-8192与OpenCoderPlus,三者均在Vicuna GPT-4评估中达到或超过ChatGPT基准分。

二、ShareGPT参与构建评测提示与参考答案

部分排行榜在构造测试用例时,会复用ShareGPT中高频出现的真实用户提问句式及对应优质回复结构,作为prompt模板或参考答案范本。这导致在评测中对“熟悉ShareGPT风格”的模型产生隐性偏置。

1、AlpacaEval的测试集包含大量与ShareGPT中human提问高度相似的指令样本;

2、MT-bench的部分多轮子任务提示设计,直接借鉴ShareGPT中“追问-修正-再响应”的典型交互链;

3、当模型在SFT阶段已充分暴露于ShareGPT数据时,其对上述提示格式的响应速度与语义匹配度显著提升,造成评测得分虚高而非泛化能力真实增强。

ChatGPT最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

下载

三、ShareGPT引发的数据污染风险干扰公平比较

由于ShareGPT数据广泛传播且未设访问控制,其内容极可能混入多个模型的预训练语料或私有微调数据中,导致评测基准与训练数据发生重叠,破坏零样本/少样本评估前提。

1、LLaMA-2官方报告指出,部分公开网页语料与ShareGPT中对话存在文本重合;

2、某开源模型在OpenCompass榜单中于“多轮对话理解”子项得分突增37%,后经溯源发现其SFT阶段使用了未经脱敏的ShareGPT-90k中英文平行版;

3、

当前主流排行榜尚未强制要求参评模型披露是否使用ShareGPT及其具体子集,构成系统性评估偏差隐患。

四、ShareGPT格式标准化降低评测适配门槛

ShareGPT采用统一的{"from":"human"/"gpt", "value":...}字段结构,与绝大多数对话模型训练框架(如HuggingFace Transformers、Axolotl)原生兼容,大幅缩短模型从训练到提交评测的周期,客观上增加其上榜概率。

1、开发者无需编写额外脚本即可将ShareGPT数据加载为标准PyTorch Dataset;

2、模型输出可直接按ShareGPT格式组织为JSONL文件,供评测平台自动解析;

3、

这种即插即用特性使中小团队能快速迭代并提交多个变体模型参与排名,加剧榜单头部模型的同质化竞争。

相关文章