织梦后台自带采集工具使用教程
织梦后台自带一个采集工具,但是大家貌似都很陌生,可能因为不实用吧,也可能市场上有更好的工具来替代,上一篇教程最详细火车头数据采集系统DedeCMS发布文章攻略,我们也介绍了今天我们来介绍下织梦后台自带采集功能使用方法,dedecms自带了文章和图片采集功能,对于不熟悉的新手建站,采集规则配置起来很麻烦,经常在采集时出错,或者乱码,现在就向朋友介绍dedecms的采集功能。
一、进入采集节点管理界面,在后台管理界面的主菜单中单击“采集”,然后单击“采集节点管理”,即可进入采集节点管理界面。
二、在采集节点管理界面中,单击左下角的“增加新节点”或者右上角的“添加新节点”如图,都可进入“选择内容模型”界面,如图所示,
三、设置节点基本信息
四、目标页面编码:设定被采集目标页的编码格式,有GB2312、UTF8和BIG5三种。可通过在被采集目标页面上,单击右键后选择“查看源文件”来获取。
五、其等号后面的代码就是所需的“编码格式”,这里是“gb2312”。
“区域匹配模式”:设定如何匹配所需采集的内容部分,可采用字符串或者正则表达式。系统默认的模式是字符串。如果比较了解正则表达式的朋友,可以在这里选择正则表达式的模式。
“内容导入顺序”:指定文章列表导入时候的顺序,可以选择“与目标站一致”或“与目标站相反”。
“防盗链模式”:针对被采集的目标站点有无刷新限制。一开始很难判断出来,需要测试后才能知道。如果有的话,这里需要设置一下“资源下载超时时间”。
“引用网址”:填入任何一个即将被采集的文章内容页面的网址。
在已打开的文章列表页中,单击第一篇文章的
六、此时在浏览器的URL地址栏中显示的网址,即为需要填写在“引用网址”处的网址,如(图)所示
七、到这里,“节点基本信息”就设置完成了。最后结果,如(图)所示,
八、检查无误后,进入下一步设置。设置列表网址获取规则
这里是设置被采集的文章列表页的匹配规则。如果被采集的文章列表页有一定的规律,可选择“批量生成列表网址”;如果被采集的文章列表页完全没有规律可循,那么可选择“手工指定列表网址”;如果被采集的站点提供了RSS,则可以选择“从RSS中获取”。对于特殊情况,例如:部分列表页有规律,而其余的又没有规律,则可在“匹配网址”中填上有规律的部分,然后把没有规律的部分填写在“手动指定网址”。
下一篇:织梦自带的采集器采集文章使用教程