一段采集程序代码

<%@LANGUAGE="JScript" CODEPAGE="936"%>
<script language=VBScript runat="Server">
Function bytes2BSTR(vIn)
    strReturn = ""
    For i = 1 To LenB(vIn)
        ThisCharCode = AscB(MidB(vIn,i,1))
        If ThisCharCode < &H80 Then
            strReturn = strReturn & Chr(ThisCharCode)
        Else
            NextCharCode = AscB(MidB(vIn,i+1,1))
            strReturn = strReturn & Chr(CLng(ThisCharCode) * &H100 + CInt(NextCharCode))
            i = i + 1
        End If
    Next
    bytes2BSTR = strReturn
End Function

Function ajaxRead(theURL)
dim XmlHttp
set XmlHttp = CreateObject("Microsoft.XMLHTTP")
XmlHttp.Open "GET", theURL, false 
XmlHttp.setRequestHeader "Content-Type","text/HTML" 
XmlHttp.Send

dim htmlstr
htmlstr = bytes2BSTR(XmlHttp.responseBody)
ajaxRead = htmlstr
End Function
</script>

<%
var ADOConn;
function OpenDatabase(){
        try{
        ADOConn = new ActiveXObject("ADODB.Connection");
        ADOConn.Open ("Provider=Microsoft.Jet.Oledb.4.0;Data Source="+Server.MapPath("getcaiku.mdb"));
        }catch(e){
                ADOConn.close;
                Response.Write("数据库连接出错,请检查连接字串。");
                Response.End;
        }
}

function CloseDatabase(){
        ADOConn.close;
}

Response.Buffer = 1;
Server.ScriptTimeout = 99999;
//////////可修改以下参数////////////////
var beginid = 230;//开始ID
var endid = 500;//结束ID
////////////////////////////////////////
var arr,tstr,tid,getdata;
var countid = 0;
Response.Write ("开始采集:从"+beginid+"到"+endid+"<hr>");
Response.Flush;
OpenDatabase();
var re=new RegExp("<title>(.*?) - 彩酷</title>","ig");

for(var fi=beginid;fi<(endid+1);fi++){
        tid = String(fi);
        getdata = ajaxRead("http://mms.caiku.com/sendcring.aspx?uid=0&id="+tid);
        if(arr = re.exec(getdata)!=null){
        tstr = String(RegExp.$1);
        if(tstr!=null&&tstr!="undefined"&&tstr!="")
        tstr = tstr.replace("'","");
        ADOConn.execute("INSERT INTO getdata(title,tid)VALUES('"+tstr+"',"+tid+")");
        Response.Write (tid+":"+tstr+" ___>OK!<br>");
        countid++;
        Response.Flush
        }
}
re.close;
CloseDatabase();
Response.Write ("<hr>采集完毕!共录入数据"+countid+"条。");
%>

(0)

相关推荐

  • 一段采集程序代码

    <%@LANGUAGE="JScript" CODEPAGE="936"%> <script language=VBScript runat="Server"> Function bytes2BSTR(vIn)     strReturn = ""     For i = 1 To LenB(vIn)         ThisCharCode = AscB(MidB(vIn,i,1))         

  • 自动采集程序

    最近在做一个音乐站,音乐文件嘛...一般是从网上收集..so..写了一段采集程序.  复制代码 代码如下: <%   On Error Resume Next   Const uploadPath = "/uploads/" '文件存放路径   Const allowFileExt = "jpg,wma,swf,gif" '允许被采集的文件类型   'Const allowFileSize = "200"   Function getFil

  • php 论坛采集程序 模拟登陆,抓取页面 实现代码

    复制代码 代码如下: <?php // 吴燕军 // 2009-06-27 // 采集程序php set_time_limit(0); //cookie保存目录 $cookie_jar = '/tmp/cookie.tmp'; /*函数------------------------------------------------------------------------------------------------------------*/ //模拟请求数据 function req

  • PHP常用的小程序代码段

    本文实例讲述了PHP常用的小程序代码段.分享给大家供大家参考,具体如下: 1.计算两个时间的相差几天 $startdate=strtotime("2009-12-09"); $enddate=strtotime("2009-12-05"); 上面的php时间日期函数strtotime已经把字符串日期变成了时间戳,这样只要让两数值相减,然后把秒变成天就可以了,比较的简单,如下: $days=round(($enddate-$startdate)/3600/24) ;

  • ASP下实现自动采集程序及入库的代码

    最近网上流行着一些采集程序,更多人拿着这些东西在网上叫卖,很多不太懂的人看着那些程序眼羡,其实如果你懂一些ASP,了解自动采集程序的原理后,你会感觉实现自动化也是那么的简单. 原理及优点:通过XML中的XMLHTTP组件调用其它网站上的网页,然后批量截取或替换原有的信息使其转化成变量后再一一储存到数据库中.其主要的优点便是无需再手工添加大量的信息了,可以指定对某一个站信息的截取进行批量录入,达到省时省力的目的.与其单纯的ASP小偷程序不同的是:它已经不再依赖其目标网站. 简单事例: 复制代码 代

  • 用Python写一段用户登录的程序代码

    如下所示: #!/usr/bin/env python #coding: utf8 import getpass db = {} def newUser(): username = raw_input('username: ') if username in db: #添加打印颜色 print "\033[32;1m%s already exists![0m" % username else: #屏幕不显示密码,调用getpass.getpass() password = getpas

  • python如何解决指定代码段超时程序卡死

    目录 python解决指定代码段超时程序卡死 python程序运行超过时长强制退出 1.程序内部设置时长,超过退出 2.程序外部控制,超过强制退出 python解决指定代码段超时程序卡死 最近我写的一个程序中遇到了解析网页的代码,对于网页信息比较多的可能会超时,最后解析失败,程序卡死,于是我就找到了一个解决办法 大致模板如下: import eventlet eventlet.monkey_patch() flag_TimeOut = True with eventlet.Timeout(40,

  • 用asp+xmlhttp编写web采集程序

    web采集程序?网页抓取程序?小倫程序?不管怎么叫,这种程序应用倒是蛮广的.本文不讨论这种使用这种程序引起的版权或道德问题,只谈这种程序在ASP+VBScript环境下的实现 :-) 预备知识:除了一般的ASP+VBScript的知识外,你还需要了解xmlhttp对象和正则表达式对象.xmlhttp对象是时下风头正劲的Ajax的主角:而学好了正则表达式,你再也不用为处理复杂的字符串犯愁. 在编写和调试正则表达式时,RegEx 这个小工具非常有用. 目录 抓取一个远程网页并保存到本地  改进:处理

  • Java实现一个小说采集程序的简单实例

    被标题吸引进来的不要骂我. 只是一个简单的实现,随手写了来下载一部喜欢的小说的.示例中的小说只是示例,不是我的菜. 使用了jsoup.挺好用的一个工具. 有需要的话,参考下自己改吧.挺简单的,是吧. 代码如下: package com.zhyea.doggie; import java.io.File; import java.io.FileWriter; import java.io.IOException; import org.jsoup.Jsoup; import org.jsoup.n

  • PHP 采集程序原理分析篇

    苦想了几天,终于弄明白了里面的道理.在这里写出来,请高手指正. 采集程序的思路很简单,无非就是先打一个页面,一般都是列表页,取得里面全部链接的地址,然后打开逐条链接,寻找我们感兴趣的东西,如果找到,就把它入库或别的处理.下面以一个很简单的例子来说说. 首先确定一个采集页,一般就是列表面了.这里目标是:http://www.jb51.net/article/11/index.htm.这是一个列表页,我们的目的就是采集这个列表页上全部的文章. 有列表页了,第一步先打开它,把它的内容纳入到我们的程序中

随机推荐