注册一亩三分地论坛,查看更多干货!
您需要 登录 才可以下载或查看附件。没有帐号?注册账号
x
本帖最后由 五农 于 2015-5-3 18:59 编辑
楼主之前报了这课 去年6月 ,可是突击GRE,就把这课当成self-paced 的了。
闲下来了又把这么课捡起来了
现在在做数据库的sql(assignment2)作业。问题是这样的:
有一个sparse matrix table : frequency(docid,term,count)作业是计算相关性矩阵 DD'(转置不会打),数据是 https://github.com/uwescience/da ... ignment2/reuters.db
最后一问是在把D矩阵加一行docid=’q‘,一行有3个term 分别是washington,taxes,treasury
为了方便就把frequency加这一行create成一个view- create view fre2 as
- SELECT * FROM frequency
- UNION
- SELECT 'q' as docid, 'washington' as term, 1 as count
- UNION
- SELECT 'q' as docid, 'taxes' as term, 1 as count
- UNION
- SELECT 'q' as docid, 'treasury' as term, 1 as count;
复制代码 然后只算q和矩阵D的相关性,就是三个词和所有其他docid行的相关性,这个楼主也做好了- select a.docid,b.docid,sum(a.count*b.count)
- from fre2 a,fre2 b
- where a.term=b.term and a.docid='q'
- group by a.docid,b.docid;
复制代码 但是他说了这个是未标准化的,楼主想做标准化后的,同时还有考虑浮点数,所以楼主加了一个“/1.0”- select a.docid,b.docid,sum(a.count*b.count)*sum(a.count*b.count)/1.0/(sum(a.count*a.count)*sum(b.count*b.count))
- from fre2 a,fre2 b
- where a.term=b.term and a.docid='q'
- group by a.docid,b.docid;
复制代码 算是算出来了,不知道对不对,而且虽然结果中也有小数,但是1还是很多。感觉还是有未转化成浮点数的,
所以请大家具体分析一下,我这样些类型能全部转化对吗?
顺便看下第二个sql是不是标准化后的结果
谢谢!

|