如何用10行代码鉴别文章有没有“洗稿”?

2023-10-18 00:20

本文主要是介绍如何用10行代码鉴别文章有没有“洗稿”?,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

最近洗稿事件闹得沸沸扬扬,挨踢哥作为一名资深吃瓜群众、伪技术专家,给大家科普一下,如何用技术手段鉴别一篇文章有没有“洗稿”嫌疑。

标题是为了吸引大家进来而已(这个看标题的时代:( ),代码远不止10行,此处省略前戏500字,直奔主题:

640?wx_fmt=jpeg

TF-IDF标签提取法

思路大致是,基于自然语言处理TF-IDF算法提取关键字,例如提取段落前5个关键字进行比较,这里面涉及到数据挖掘、文本处理、信息检索等计算机前沿牛B领域,挨踢哥如果讲得清楚,就不坐在这码字了,有兴趣的自行google下。

取3个段落中最长的句子simhash

simhash是google用来处理海量文本去重的算法。google出品,你懂的。simhash最牛逼的一点就是将一个文档,最后转换成一个64位的字节,暂且称之为特征字,然后判断重复只需要判断他们的特征字的距离是不是<n(根据经验这个n一般取值为3),就可以判断两个文档是否相似。

用机器学习词向量+余弦相似度

读取样本文本,对文本进行utf-8编码转换,对文本进行预处理,完成中文分词,形成词条库,并去除停用词;读取文本词条库,统计每个词条的词频,词频代表了每个词对一段文本的重要程度,字词的重要性随着它在文件中出现的次数成正比增加;对上一步整理形成的每个词的词频组成文本的词条词频特征码;使用1-5的方法分析待分类文本,生成待分类文本的词条词频特征码;将待分类文本的词条词频与样本的词条词频特征码进行比较,应用余弦相似度算法判断待分类文本与样本的相似度,取最相似的类型为最终分类的类型。


精彩文章推荐:

  • 神秘的霍金预言时间表,2060年人类将搬离地球,2100年新人种出现

  • 周鸿祎:写区块链最好的一篇文章

  • 40G的AI、深度学习、大数据视频学习资料,全部共享!

  • 区块链学习资料下载(累计13小时课程),行业大牛亲口讲授!

  • 微服务架构(Spring boot)学习视频,31课时,全部共享啦!

  • 区块链入门教程,看这篇就够了

  • 马斯克:SpaceX成功的背后,经历了18次失败、被骂是骗子

  • 论IT人士如何在会议室里优雅的装逼?

  • 我凭自己的本事写BUG,你有什么资格说我?

  • 高效能技术Leader的30条军规!

  • 优秀技术Leader应具备的六项能力!

  • 产品经理的10大谎言,你中招几个?

640?wx_fmt=jpeg

这篇关于如何用10行代码鉴别文章有没有“洗稿”?的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/228917

相关文章

活用c4d官方开发文档查询代码

当你问AI助手比如豆包,如何用python禁止掉xpresso标签时候,它会提示到 这时候要用到两个东西。https://developers.maxon.net/论坛搜索和开发文档 比如这里我就在官方找到正确的id描述 然后我就把参数标签换过来

poj 1258 Agri-Net(最小生成树模板代码)

感觉用这题来当模板更适合。 题意就是给你邻接矩阵求最小生成树啦。~ prim代码:效率很高。172k...0ms。 #include<stdio.h>#include<algorithm>using namespace std;const int MaxN = 101;const int INF = 0x3f3f3f3f;int g[MaxN][MaxN];int n

计算机毕业设计 大学志愿填报系统 Java+SpringBoot+Vue 前后端分离 文档报告 代码讲解 安装调试

🍊作者:计算机编程-吉哥 🍊简介:专业从事JavaWeb程序开发,微信小程序开发,定制化项目、 源码、代码讲解、文档撰写、ppt制作。做自己喜欢的事,生活就是快乐的。 🍊心愿:点赞 👍 收藏 ⭐评论 📝 🍅 文末获取源码联系 👇🏻 精彩专栏推荐订阅 👇🏻 不然下次找不到哟~Java毕业设计项目~热门选题推荐《1000套》 目录 1.技术选型 2.开发工具 3.功能

代码随想录冲冲冲 Day39 动态规划Part7

198. 打家劫舍 dp数组的意义是在第i位的时候偷的最大钱数是多少 如果nums的size为0 总价值当然就是0 如果nums的size为1 总价值是nums[0] 遍历顺序就是从小到大遍历 之后是递推公式 对于dp[i]的最大价值来说有两种可能 1.偷第i个 那么最大价值就是dp[i-2]+nums[i] 2.不偷第i个 那么价值就是dp[i-1] 之后取这两个的最大值就是d

pip-tools:打造可重复、可控的 Python 开发环境,解决依赖关系,让代码更稳定

在 Python 开发中,管理依赖关系是一项繁琐且容易出错的任务。手动更新依赖版本、处理冲突、确保一致性等等,都可能让开发者感到头疼。而 pip-tools 为开发者提供了一套稳定可靠的解决方案。 什么是 pip-tools? pip-tools 是一组命令行工具,旨在简化 Python 依赖关系的管理,确保项目环境的稳定性和可重复性。它主要包含两个核心工具:pip-compile 和 pip

D4代码AC集

贪心问题解决的步骤: (局部贪心能导致全局贪心)    1.确定贪心策略    2.验证贪心策略是否正确 排队接水 #include<bits/stdc++.h>using namespace std;int main(){int w,n,a[32000];cin>>w>>n;for(int i=1;i<=n;i++){cin>>a[i];}sort(a+1,a+n+1);int i=1

html css jquery选项卡 代码练习小项目

在学习 html 和 css jquery 结合使用的时候 做好是能尝试做一些简单的小功能,来提高自己的 逻辑能力,熟悉代码的编写语法 下面分享一段代码 使用html css jquery选项卡 代码练习 <div class="box"><dl class="tab"><dd class="active">手机</dd><dd>家电</dd><dd>服装</dd><dd>数码</dd><dd

生信代码入门:从零开始掌握生物信息学编程技能

少走弯路,高效分析;了解生信云,访问 【生信圆桌x生信专用云服务器】 : www.tebteb.cc 介绍 生物信息学是一个高度跨学科的领域,结合了生物学、计算机科学和统计学。随着高通量测序技术的发展,海量的生物数据需要通过编程来进行处理和分析。因此,掌握生信编程技能,成为每一个生物信息学研究者的必备能力。 生信代码入门,旨在帮助初学者从零开始学习生物信息学中的编程基础。通过学习常用

husky 工具配置代码检查工作流:提交代码至仓库前做代码检查

提示:这篇博客以我前两篇博客作为先修知识,请大家先去看看我前两篇博客 博客指路:前端 ESlint 代码规范及修复代码规范错误-CSDN博客前端 Vue3 项目开发—— ESLint & prettier 配置代码风格-CSDN博客 husky 工具配置代码检查工作流的作用 在工作中,我们经常需要将写好的代码提交至代码仓库 但是由于程序员疏忽而将不规范的代码提交至仓库,显然是不合理的 所

Unity3D自带Mouse Look鼠标视角代码解析。

Unity3D自带Mouse Look鼠标视角代码解析。 代码块 代码块语法遵循标准markdown代码,例如: using UnityEngine;using System.Collections;/// MouseLook rotates the transform based on the mouse delta./// Minimum and Maximum values can