MuleRun提供四种去重方案:一、启用Agent内置查重模块,通过语义相似度比对实现本地化去重;二、调用专用Multi-Format Deduplicator Agent,支持文本、图像、表格的精确指纹去重;三、通过结构化Prompt指令激活通用Agent隐式去重逻辑;四、导出后用Excel UNIQUE函数二次校验。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜如果您在使用MuleRun处理文本、图片或结构化数据时,需要识别并移除重复内容,则可能是由于任务中存在冗余输入、历史记录叠加或批量上传时未做预筛。以下是实现自动检测与去重的具体操作路径:
一、启用Agent内置查重模块
MuleRun平台部分Agent已集成轻量级语义查重能力,适用于文案生成、会议纪要整理、用户反馈归类等场景。该模块基于嵌入向量相似度比对,在不暴露原始文本的前提下完成本地化去重判定。
1、进入
mulerun.com/chat,启动目标Agent(如“会议摘要助手”或“用户评论聚合器”)。
2、在对话框中明确输入指令:
请先检测并合并语义重复的条目,再执行总结。
3、上传待处理文件(支持TXT、CSV、PDF),等待Agent返回带标记的去重结果页。
4、点击结果页右上角“导出去重后数据”按钮,下载净化后的结构化输出。
二、调用专用去重Agent
在MuleRun Agent Store中,存在专用于多模态内容去重的独立Agent,覆盖文本段落、图像哈希、表格行级比对三类模式。该Agent采用确定性指纹算法+局部敏感哈希(LSH),可规避语义近似误判,保留原始格式不变。
1、访问mulerun.com/explor,于搜索栏输入关键词
deduplicate或去重。
2、从列表中选择标有“Multi-Format Deduplicator v2.1”的Agent,查看其支持的输入类型图标(文本/图像/Excel)。
3、点击“运行”,按提示上传单个或多个文件;若为Excel,系统将自动识别首行为表头,并默认启用全列联合唯一性判断。
4、勾选“保留首次出现项”选项,取消勾选“模糊匹配”以启用精确指纹比对。
5、点击“开始处理”,进度条完成后,页面显示删除数量、保留数量及重复项样本快照。
MuleRun全球首个AI Agent交易平台下载
三、通过Prompt工程触发隐式去重逻辑
对于尚未封装查重功能的通用型Agent,可通过结构化指令激活其底层去重机制。该方式依赖MuleRun自进化模型对自然语言指令的理解泛化能力,无需修改Agent配置。
1、在任意Agent聊天界面中,输入完整指令:
以下内容需严格去重:每段文字仅保留第一次出现的完整原文,后续完全一致的段落跳过,不改写、不合并、不解释,请直接输出净化后的内容流。
2、紧接指令后粘贴原始文本块,确保段落间以空行分隔。
3、发送后观察Agent响应头部是否出现标识符【DEDUP: ACTIVE】,如有则表示去重逻辑已加载。
4、若返回结果中仍含重复,可在下一轮对话中追加指令:
请列出所有被跳过的重复段落原文及其出现位置序号,用于人工复核边界案例。
四、结合UNIQUE函数后处理导出数据
当MuleRun输出为Excel或CSV格式时,可在本地使用Excel UNIQUE函数进行二次校验与动态维护。该方法适用于需长期追踪去重状态、或与其他系统联动更新的业务流。
1、将MuleRun导出的CSV文件用Excel打开,确认数据从A1单元格起始且无合并单元格。
2、在空白列第一行(如D1)输入公式:
=UNIQUE(A1:C1000),其中A1:C1000为实际数据区域。
3、按Enter确认,Excel将自动扩展结果区域,显示唯一组合行。
4、选中UNIQUE函数输出区域,右键→“复制”,另起工作表→右键→“选择性粘贴→数值”,固化结果。
5、对比原始列与UNIQUE列行数差值,即为MuleRun本次处理所识别的重复行数量。
