一、需求文件
??? heritrix-1.41.3-src.zip
??? heritrix-1.14.3.zip
??? 在http://sourceforge.net/project/showfiles.php?group_id=73833&package_id=73980可以下载
二、准备
??? 把下载的两个文件分别解压到不同的目录中
三、在eclipse中新建一个java appliction
??? 分别把heritrix-1.14.3.zip的解压文件中的conf,webapps,lib文件夹拷到工程中
??? 如图所示heritrix-1.jpg
????????????????????????????????????????????????
??? 把heritrix-1.14.3-src.zip的解压目录下的java目录中的META-INF,org,st目录拷贝到工程目录的src目录下,把heritrix-1.14.3.zip的解压文件中的profiles,mudules,selftest目录拷贝到src目录下
??? 配置后如图heritrix-2.jpg
????????????????????????????????????????????????????
??? 在conf/heritrix.properties中配置用户名密码
??? 如图heritrix-3.jpg
???????????????????????????????????????
四、工程基本搭建完成,把工程下的lib中的jar文件配置到工程中(Build Path)
五、运行org.archive.crawler.Heritrix类,工程启动
六、访问http://localhost:8080/