在开放提交数据的系统,例如wiki,总是无法拒绝别人用bot提交大量无用、无关或者误导性数据,这是最头痛的一个问题。不要觉得Google懂得对作弊网站使用PageRank Zero惩罚或者wiki自身有一定anti-spam技术就行了,当spam发展到有一定智能??像Google AdWords那样的"针对性投放"的智能,那wiki就会麻烦了!
暂时来说,Google AdWords允许你买一个词,然后在用户搜索这个词的时候就投放你的链接广告,同时按照投放收费,例如Nike就可以买下shoe这个词作为AdWords(不过Nike买下竞争对手的名字作为AdWords是否合法这个问题就很有争议性)。那么我们可以按照同样的原则作一个spam-bot,例如就去Wikipedia等大型wiki上面直接进入[[shoe]]这个WikiName,然后在最后直接tag上Nike的广告,然后开一个[[Nike]]的WikiName也可以,如果竞争对手的名称也是WikiName那就也过去tag上Nike的名称(介绍为竞争对手的竞争对手),这样的内容就算肉眼看起来也绝对不spam啊你觉得在[[shoe]]里面介绍Nike或者在竞争对手的WikiPage里面说它的主要竞争对手是Nike算是spam吗?
2005年6月6日星期一
2005年6月3日星期五
Search Inside!
人类对太空的探索比对地球内部的探索还要多,因而对太空的了解也比地球内部多,可能是因为了解外部比了解内部要更容易。
在MyWallop上面见到wm说雨伞不见了竟然还有用Google Desktop Search来搜索一下的冲动,我觉得这也挺有意思。我们天天用Google搜索外界的信息--我们要的技术资料、新闻、图片,还用Gmail搜索邮件,但是我们对内部信息却常常已往并且无法搜索——你还记得两三年前看过的一份技术资料是在哪本技术书上面吗?你还记得这本技术书现在在你的哪个书柜的哪层吗?
从暂时的技术含量来看,内部搜索基本上是不可能实现的,因为要对内部的物理存在的事物进行Index是非常困难的(之前提到的DVD Indexer则已经是最容易实现的一个方面),而这暂时只能靠人手录入,或者录入的自动化程度很低(DVD Indexer能够完全实现自动化,仅仅是你再刻碟后运行一下就完成索引,那已经是最好的事情了),这可能是在此领域一直无法发展的原因。
在MyWallop上面见到wm说雨伞不见了竟然还有用Google Desktop Search来搜索一下的冲动,我觉得这也挺有意思。我们天天用Google搜索外界的信息--我们要的技术资料、新闻、图片,还用Gmail搜索邮件,但是我们对内部信息却常常已往并且无法搜索——你还记得两三年前看过的一份技术资料是在哪本技术书上面吗?你还记得这本技术书现在在你的哪个书柜的哪层吗?
从暂时的技术含量来看,内部搜索基本上是不可能实现的,因为要对内部的物理存在的事物进行Index是非常困难的(之前提到的DVD Indexer则已经是最容易实现的一个方面),而这暂时只能靠人手录入,或者录入的自动化程度很低(DVD Indexer能够完全实现自动化,仅仅是你再刻碟后运行一下就完成索引,那已经是最好的事情了),这可能是在此领域一直无法发展的原因。
2005年5月16日星期一
DVD Indexer
由于WM和Piggest这样的eMuler & DVD Burner经常大量下载又经常进行"硬盘解放运动",所以我想做一个DVD Indexer。
所谓DVD Indexer,就是能够帮你刻录的DVD进行文件索引的一个软件,索引放在硬盘上或者发布到网站上,数据量尽量少,但又要保证搜索文件时的方便。这个DVD Indexer进行的索引包括3个方面:
1.目录和文件名索引:对所有目录名和文件名进行索引,这是最近本的工作。
2.原数据或全文索引:对于txt、doc、pdf等可以转换为纯文本的文件进行全文索引,对于mp3、avi、doc等有原数据(meta-data)好像P2P软件那样作原数据索引。
3.用户备注索引:用户可以针对目录和文件再写备注自行作索引。
现在最关键的问题是,数据量的大小。理论上好像P2P软件那样,仅作meta-data和hash索引是很小的,所以我们对部分文件加上全文索引也应该不会太大。不过对于发布到网站的事情(这可能会让一些warez的网站感兴趣),就不一定足够小了。(详细索引数据怎么分布式或集中式存放,详细要参考P2P软件。)
所谓DVD Indexer,就是能够帮你刻录的DVD进行文件索引的一个软件,索引放在硬盘上或者发布到网站上,数据量尽量少,但又要保证搜索文件时的方便。这个DVD Indexer进行的索引包括3个方面:
1.目录和文件名索引:对所有目录名和文件名进行索引,这是最近本的工作。
2.原数据或全文索引:对于txt、doc、pdf等可以转换为纯文本的文件进行全文索引,对于mp3、avi、doc等有原数据(meta-data)好像P2P软件那样作原数据索引。
3.用户备注索引:用户可以针对目录和文件再写备注自行作索引。
现在最关键的问题是,数据量的大小。理论上好像P2P软件那样,仅作meta-data和hash索引是很小的,所以我们对部分文件加上全文索引也应该不会太大。不过对于发布到网站的事情(这可能会让一些warez的网站感兴趣),就不一定足够小了。(详细索引数据怎么分布式或集中式存放,详细要参考P2P软件。)
2005年5月7日星期六
关于模拟游戏和Spore
Will Wright,也就是Maxis的设计师、sims之父,提出了个代号Spore的模拟游戏。关于这个游戏的资料,GameSpy的可以看看这里:
http://www.gamespy.com/articles/595/595975p1.html
中文方面,有TLF的一些文章:
http://webtlf88.eastgame.net/read.php?tid=650329
http://webtlf88.eastgame.net/read.php?tid=648131
http://webtlf88.eastgame.net/read.php?tid=648025
反正游戏的大意就是,你从一个刨子(Spore)开始创造生命,可以定义它的各种生物特性,然后随着它从海洋攀上陆地,从部落形成城市,每一次你都可以为它添加更高级/复杂的生物特性。与此同时,你的生物的进化也需要不断的击败其他的生物,直到发展太空技术侵略其他星球侵略其他星系。
这个游戏听起来非常有趣,因为模拟游戏现在最需要突破的一个地方就是模拟的随机性,因为以前的模拟游戏中Player往往很容易从游戏中归纳出游戏的规律,例如Simcity中如何布局公共设施才能充分利用,或者Sims中如何保持一个人的各种状态尽量高,然后就按照这样玩,甚至大家交流经验。这样下去,Player对游戏内部计算的了解就很快趋向于Designer,游戏的可玩性就降低了。解决方案最好就是,增加游戏的复杂度,增加随机情况,复杂到就算Designer知道计算方法但是人脑本身无法对如此复杂的情况进行推算,于是这个游戏便得更耐玩。(当然,随机度不是可以随意增加的,整个游戏必须有一种内部的逻辑体系,就好像科幻/奇幻小说一样,虽然有些地方和现实不同,但是内部逻辑不相互矛盾,内部特点的逻辑严密,相互推理成立。)
虽然不知道Spore什么时候出现,但是我在想一个更坏的主意??如果有一个游戏不断给Player希望但是又把Player向另外一个方向拉,这就更爽了(站在Designer的角度看),哈哈!例如现在号称很自由的一些D&D和RTS,或者我们就说Black & White(善与恶),我们就讨论这个游戏中很多事情Player都可以选择善与恶两种做法??对于别的神属下的村子无论你是用你的神力去帮助他们还是破坏他们都会让他们减少对原来的神的信仰增加对你的信仰,但无论如何,你在游戏中实行一个操作的时候你对游戏内部的逻辑推理很明确、你对你的目标很明确,所以你的操作的方向性也很明确,结果只存在成效大小之分。然而我的理念就是,例如在Spore中,你努力创建一个热爱和平的种族,努力让他们和其他种族和谐共处,但讽刺的是游戏中你按这个思路去发展你的种族的结果是你的种族最后变得像蝗虫一样,他们必须不停地从一颗星转移到另一颗星,然后消耗尽上面的资源,然而最重要的是这一切均符合这个游戏的“内部逻辑推理”(千万别忘记我上面说的内部符合逻辑的重要性)。
总而言之,我有个真正的Game Plays Man的想法,而不仅仅是NFS(极品飞车)里面的Catch-up机制(你的车越快对手就越快,反之亦然,总之你很快很快了只要稍慢就给对手超,你很慢很慢了对手也只是在你前面给你追上去的希望)。就好像一个很坏的DM(GM)一样,总是给希望给机会Player向他希望的方向引导游戏,然后告诉Player实际上你所做的一切刚刚好让你背离了你的目标,哈哈!
http://www.gamespy.com/articles/595/595975p1.html
中文方面,有TLF的一些文章:
http://webtlf88.eastgame.net/read.php?tid=650329
http://webtlf88.eastgame.net/read.php?tid=648131
http://webtlf88.eastgame.net/read.php?tid=648025
反正游戏的大意就是,你从一个刨子(Spore)开始创造生命,可以定义它的各种生物特性,然后随着它从海洋攀上陆地,从部落形成城市,每一次你都可以为它添加更高级/复杂的生物特性。与此同时,你的生物的进化也需要不断的击败其他的生物,直到发展太空技术侵略其他星球侵略其他星系。
这个游戏听起来非常有趣,因为模拟游戏现在最需要突破的一个地方就是模拟的随机性,因为以前的模拟游戏中Player往往很容易从游戏中归纳出游戏的规律,例如Simcity中如何布局公共设施才能充分利用,或者Sims中如何保持一个人的各种状态尽量高,然后就按照这样玩,甚至大家交流经验。这样下去,Player对游戏内部计算的了解就很快趋向于Designer,游戏的可玩性就降低了。解决方案最好就是,增加游戏的复杂度,增加随机情况,复杂到就算Designer知道计算方法但是人脑本身无法对如此复杂的情况进行推算,于是这个游戏便得更耐玩。(当然,随机度不是可以随意增加的,整个游戏必须有一种内部的逻辑体系,就好像科幻/奇幻小说一样,虽然有些地方和现实不同,但是内部逻辑不相互矛盾,内部特点的逻辑严密,相互推理成立。)
虽然不知道Spore什么时候出现,但是我在想一个更坏的主意??如果有一个游戏不断给Player希望但是又把Player向另外一个方向拉,这就更爽了(站在Designer的角度看),哈哈!例如现在号称很自由的一些D&D和RTS,或者我们就说Black & White(善与恶),我们就讨论这个游戏中很多事情Player都可以选择善与恶两种做法??对于别的神属下的村子无论你是用你的神力去帮助他们还是破坏他们都会让他们减少对原来的神的信仰增加对你的信仰,但无论如何,你在游戏中实行一个操作的时候你对游戏内部的逻辑推理很明确、你对你的目标很明确,所以你的操作的方向性也很明确,结果只存在成效大小之分。然而我的理念就是,例如在Spore中,你努力创建一个热爱和平的种族,努力让他们和其他种族和谐共处,但讽刺的是游戏中你按这个思路去发展你的种族的结果是你的种族最后变得像蝗虫一样,他们必须不停地从一颗星转移到另一颗星,然后消耗尽上面的资源,然而最重要的是这一切均符合这个游戏的“内部逻辑推理”(千万别忘记我上面说的内部符合逻辑的重要性)。
总而言之,我有个真正的Game Plays Man的想法,而不仅仅是NFS(极品飞车)里面的Catch-up机制(你的车越快对手就越快,反之亦然,总之你很快很快了只要稍慢就给对手超,你很慢很慢了对手也只是在你前面给你追上去的希望)。就好像一个很坏的DM(GM)一样,总是给希望给机会Player向他希望的方向引导游戏,然后告诉Player实际上你所做的一切刚刚好让你背离了你的目标,哈哈!
2005年5月1日星期日
做个Stealth Meter以敌对搜索引擎怎样?
Coo的Fisher看起来不错,不过我想做个相反的东西——Stealth Meter——输入你的个人信息,又或者其它你想保密的信息(集合),然后看看能否躲过搜索引擎。
首先需要强调的是,输入的信息必须是关于目标的多个方面的。如果你只输入Cat,就算网上没有任何关于关于我的这个用户名的信息,还是会返回很多结果。必须在输入Cat,以及我的生日、城市等更多信息后,如果仍然能够躲过搜索引擎,那才叫做Stealth。
其实关于逃避搜索引擎的事情,我注意了很久了。Benny曾经说过,很佩服师大计算机系的一个教授,网上无论如何搜索,都找不到他的电话甚至是email。这事情让我觉得在网上隐身也是一种能力。
今时今日的搜索引擎之能够搜索文本记载的东西,但已经顶得上以前的任何国家图书馆/档案馆了,谁也不知道以后还会有什么现在军用的技术变成民用,例如指纹和声纹的搜索——或许你以后能够通过一段叫床声搜索AV添,who knows...
所以我觉得如果可能的话,就利用meta-search(源搜索)引擎的技术,只不过把它反过来用,制作一个stealth meter。原本meta-search是将搜索内容提交给各大搜索引擎搜索,然后根据各大搜索引擎的结果进行综合处理返回自己的搜索结果以及排名的。而反过来用的话,那就是我们不再关注如何正向排名,而关注反向排名,排得越后越好,最好就根本不在结果上。以后随着搜索技术的发展,这个Stealth Meter也要与时俱进,不多更新新的搜索功能。当然,Stealth Meter不应该仅仅告诉用户你在哪里泄密了,最好还能建议用户,你在哪些方面比较容易泄密,你需要注意哪些地方填写/发布的资料。
首先需要强调的是,输入的信息必须是关于目标的多个方面的。如果你只输入Cat,就算网上没有任何关于关于我的这个用户名的信息,还是会返回很多结果。必须在输入Cat,以及我的生日、城市等更多信息后,如果仍然能够躲过搜索引擎,那才叫做Stealth。
其实关于逃避搜索引擎的事情,我注意了很久了。Benny曾经说过,很佩服师大计算机系的一个教授,网上无论如何搜索,都找不到他的电话甚至是email。这事情让我觉得在网上隐身也是一种能力。
今时今日的搜索引擎之能够搜索文本记载的东西,但已经顶得上以前的任何国家图书馆/档案馆了,谁也不知道以后还会有什么现在军用的技术变成民用,例如指纹和声纹的搜索——或许你以后能够通过一段叫床声搜索AV添,who knows...
所以我觉得如果可能的话,就利用meta-search(源搜索)引擎的技术,只不过把它反过来用,制作一个stealth meter。原本meta-search是将搜索内容提交给各大搜索引擎搜索,然后根据各大搜索引擎的结果进行综合处理返回自己的搜索结果以及排名的。而反过来用的话,那就是我们不再关注如何正向排名,而关注反向排名,排得越后越好,最好就根本不在结果上。以后随着搜索技术的发展,这个Stealth Meter也要与时俱进,不多更新新的搜索功能。当然,Stealth Meter不应该仅仅告诉用户你在哪里泄密了,最好还能建议用户,你在哪些方面比较容易泄密,你需要注意哪些地方填写/发布的资料。
2004年6月2日星期三
TextGem Pro Final is coming...
TextGem Pro [1.5 Build 2145] Final
The first letter of "Final" comes red.
The first letter of "Final" comes red.
2004年5月28日星期五
2004年5月24日星期一
2004年5月16日星期日
New Blog Started
I'll use this blog to post news of ALL my projects.
Here are some old blogs of my project:
TextGem Pro DevDiary
CommentMe DevDiary
Quickling DevDiary
Here are some old blogs of my project:
TextGem Pro DevDiary
CommentMe DevDiary
Quickling DevDiary
订阅:
博文 (Atom)