学姐实习回来前就搬到新宿舍了。她准备用从学姐那里借来的校园卡洗个澡,希望能顺利地忘记烦恼。
……
第二天,凌志早早来到实验室。今天周六,实验室也会有同学过来,但比一般时候来的晚一些。凌志并没有像往常一样打开论文,而是打开一款接单软件。
自从他学会给自己采集数据之后,凌志觉得自己的这项技能不能被埋没啊,于是给自己找了个活儿干,每周末给一些客户整理一些公开数据集,不会占据自己太多的时间。
凌志在线挂了一会儿,今天的第一个客户出现了。
“您好,在吗?”
“在的亲,请问您想要采集什么数据呢?”
“您好,请问可以帮忙分析数据吗?”
分析数据啊,凌志不是专门做数据分析的,但是能不能做要看情况。如果只是做一些简单的统计的话……
“您可以把您的需求发出来,我看看能不能做。”
“好的,我是想计算一下行业内每两个公司之间的相似度……”
凌志听着客户的需求,也不时提出一些疑问。回答完之后根据数据量给出了一个报价以及预期交付时间,客户并没有多砍价,就这么敲定了。
实际上计算文本相似度的方法有很多,比如统计两个文本中有没有词语同时出现,出现频率是否相近,标点符号使用频率是否一致等等。但这些统计都是表层的统计,句子语义深层次的相似度没有办法通过
本章还未完,请点击下一页继续阅读>>>