织梦后台自带采集工具使用教程

作者: 本站原创  发布时间:  浏览:

织梦后台自带一个采集工具,但是大家貌似都很陌生,可能因为不实用吧,也可能市场上有更好的工具来替代,上一篇教程最详细火车头数据采集系统DedeCMS发布文章攻略,我们也介绍了今天我们来介绍下织梦后台自带采集功能使用方法,dedecms自带了文章和图片采集功能,对于不熟悉的新手建站,采集规则配置起来很麻烦,经常在采集时出错,或者乱码,现在就向朋友介绍dedecms的采集功能。

一、进入采集节点管理界面,在后台管理界面的主菜单中单击“采集”,然后单击“采集节点管理”,即可进入采集节点管理界面。

二、在采集节点管理界面中,单击左下角的“增加新节点”或者右上角的“添加新节点”如图,都可进入“选择内容模型”界面,如图所示,

织梦后台自带采集工具使用教程
 
 

三、设置节点基本信息

织梦采集,采集工具,织梦后台采集功能使用

 

四、目标页面编码:设定被采集目标页的编码格式,有GB2312、UTF8和BIG5三种。可通过在被采集目标页面上,单击右键后选择“查看源文件”来获取。

 
操作步骤:
 
(a)打开被采集的目标页:http://网站域名/knowledge/web-based/dreamweaver/;
 
单击右键后选择“查看源文件”,找到“charset
 
织梦后台自带采集工具使用教程
 

五、其等号后面的代码就是所需的“编码格式”,这里是“gb2312”。

“区域匹配模式”:设定如何匹配所需采集的内容部分,可采用字符串或者正则表达式。系统默认的模式是字符串。如果比较了解正则表达式的朋友,可以在这里选择正则表达式的模式。

“内容导入顺序”:指定文章列表导入时候的顺序,可以选择“与目标站一致”或“与目标站相反”。

“防盗链模式”:针对被采集的目标站点有无刷新限制。一开始很难判断出来,需要测试后才能知道。如果有的话,这里需要设置一下“资源下载超时时间”。

“引用网址”:填入任何一个即将被采集的文章内容页面的网址。

在已打开的文章列表页中,单击第一篇文章的

织梦采集工具,织梦采集使用教程

六、此时在浏览器的URL地址栏中显示的网址,即为需要填写在“引用网址”处的网址,如(图)所示

织梦采集工具,织梦采集教程

七、到这里,“节点基本信息”就设置完成了。最后结果,如(图)所示,

织梦采集工具,织梦采集插件,采集教程

八、检查无误后,进入下一步设置。设置列表网址获取规则

采集工具,采集插件,织梦采集使用

这里是设置被采集的文章列表页的匹配规则。如果被采集的文章列表页有一定的规律,可选择“批量生成列表网址”;如果被采集的文章列表页完全没有规律可循,那么可选择“手工指定列表网址”;如果被采集的站点提供了RSS,则可以选择“从RSS中获取”。对于特殊情况,例如:部分列表页有规律,而其余的又没有规律,则可在“匹配网址”中填上有规律的部分,然后把没有规律的部分填写在“手动指定网址”。

 

上一篇:网站内容采集软件、采集软件大全盘点

下一篇:织梦自带的采集器采集文章使用教程

相关文章

织梦采集侠破解版下载v2.8及使用方法

火车头采集下载图片保存到本地路径设置方法

火车头采集织梦的文章是动态的改成静态

织梦火车头采集软件采集教程(采集器破解版+发布

阿里云虚拟主机.htaccess设置防盗链代码写法

添加微信
添加微信,免费咨询

15205695834

新手指南支付购买售后服务关于我们版权合规
合肥秀站网络科技有限公司
Copyright 2002-2022 麦站 版权所有
皖ICP备12018676号 网站地图