Golang爬虫框架colly使用浅析
作者:q56731523 发布时间:2024-02-06 23:28:06
Golang 是一门非常适合编写网络爬虫的语言,它有着高效的并发处理能力和丰富的网络编程库。下面是一个简单的 Golang 网络爬虫示例:
package main
import (
"fmt"
"net/http"
"io/ioutil"
"regexp"
)
func main() {
resp, err := http.Get("https://www.example.com")
if err != nil {
fmt.Println("Error:", err)
return
}
defer resp.Body.Close()
body, err := ioutil.ReadAll(resp.Body)
if err != nil {
fmt.Println("Error:", err)
return
}
re := regexp.MustCompile("<title>(.*)</title>")
title := re.FindStringSubmatch(string(body))[1]
fmt.Println("Title:", title)
}
这个爬虫的功能是获取指定网站的标题。代码中使用了 Go 的标准库 net/http 和 regexp 来进行网络请求和正则表达式匹配。当然,这只是一个简单的示例,实际上爬虫需要考虑更多的问题,比如反爬虫、数据存储、并发控制等等。
gocolly是用go实现的网络爬虫框架,我这里用来测试的版本是:colly “github.com/gocolly/colly/v2”
gocolly的网络爬虫还是很强大,下面我们通过代码来看一下这个功能的使用
package main
import (
"fmt"
colly "github.com/gocolly/colly/v2"
"github.com/gocolly/colly/v2/debug"
)
func main() {
mUrl := "http://www.ifeng.com/"
//colly的主体是Collector对象,管理网络通信和负责在作业运行时执行附加的回掉函数
c := colly.NewCollector(
// 开启本机debug
colly.Debugger(&debug.LogDebugger{}),
)
//发送请求之前的执行函数
c.OnRequest(func(r *colly.Request) {
fmt.Println("这里是发送之前执行的函数")
})
//发送请求错误被回调
c.OnError(func(_ *colly.Response, err error) {
fmt.Print(err)
})
//响应请求之后被回调
c.OnResponse(func(r *colly.Response) {
fmt.Println("Response body length:", len(r.Body))
})
//response之后会调用该函数,分析页面数据
c.OnHTML("div#newsList h1 a", func(e *colly.HTMLElement) {
fmt.Println(e.Text)
})
//在OnHTML之后被调用
c.OnScraped(func(r *colly.Response) {
fmt.Println("Finished", r.Request.URL)
})
//这里是执行访问url
c.Visit(mUrl)
}
运行结果如下:
这里是发送之前执行的函数
[000001] 1 [ 1 - request] map["url":"http://www.ifeng.com/"] (0s)
[000002] 1 [ 1 - responseHeaders] map["status":"OK" "url":"http://www.ifeng.com/"] (64.9485ms)
Response body length:250326
Finished http://www.ifeng.com/
[000003] 1 [ 1 - response] map["status":"OK" "url":"http://www.ifeng.com/"] (114.9949ms)
[000004] 1 [ 1 - html] map["selector":"div#newsList h1 a" "url":"http://www.ifeng.com/"] (118.9926ms)
[000005] 1 [ 1 - html] map["selector":"div#newsList h1 a" "url":"http://www.ifeng.com/"] (118.9926ms)
[000006] 1 [ 1 - scraped] map["url":"http://www.ifeng.com/"] (118.9926ms)
总结一下:
回调函数的调用顺序如下:
OnRequest在发起请求前被调用
OnError请求过程中如果发生错误被调用
OnResponse收到回复后被调用
OnHTML在OnResponse之后被调用,如果收到的内容是HTML
OnScraped在OnHTML之后被调用
来源:https://blog.csdn.net/weixin_44617651/article/details/130575725
猜你喜欢
- 这是由十几位视觉设计师设计的挂历,每个月份都是不同的风格,就像每个月都有不同温度和心情一样,思维跳跃性很大,可以作为挂历设计参考。当然,如果
- 目录方法一:直接调用函数运行方法二:使用偏函数来执行方法三:使用 eval 动态执行方法四:使用 getattr 动态获取执行方法五:使用类
- 当你要使用data URI scheme的时候,你会发现,虽然他可以使用在绝大多数浏览器上,但无法再IE6和IE7上工作。不过值得庆幸的这一
- 使用transaction: var stopwatch = new Stopwatch(); us
- 读取docx文档使用的包是python-docx1. 安装python-docx包sudo pip install python-docx2
- 使用mysql5.5,突然root密码忘记,怎么也登录不了,很急人,该怎么解决呢?下面通过本文给大家介绍mysql5.5忘记root密码的解
- SELECT语句的完整语法为:(7) SELECT (8) DISTINCT <select_list>(1) FROM <
- 本文实例讲述了Python实现简单的文本相似度分析操作。分享给大家供大家参考,具体如下:学习目标:1.利用gensim包分析文档相似度2.使
- Python是一种高级编程语言,它在众多编程语言中,拥有极高的人气和使用率。Python中的多进程和进程池是其强大的功能之一,可以让我们更加
- IronPython是一种在 .NET及 Mono上的 Python实现,由微软的 Jim Hugunin所发起,是一个开源的项目,基于微软
- 使用Python如何操作Redis呢?下面用实例来说明用Python读写Redis数据库。比如,我们插入一条数据,如下:import red
- 系统环境:VC6 + Python-2.5.41、下载Python-2.5.4源码。2、解压,打开D:\Python-2.5.4\PC\VC
- 1. 卡住是怎么办按照以下步骤, 前提是你需要懂点英文:尽可能自己想办法解决仔细阅读相关文档, 确保不错过任何相关内容在Google, 百度
- 库的管理1、库的管理创建、修改、删除1、库的创建CREATE DATABASE UF NOT EXISTS books;2、库的修改库名一般
- 每天面对成堆的发票,无论是发票还是承兑单据,抑或是其他各类公司数据要从照片、PDF等不同格式的内容中提取,我们都有必要进行快速办公的能力提升
- pycharm全局修改pycharm 全局改函数方法1ctrl shift r全局替换方法2点击函数,右键 Refactor Ch
- 本文实例为大家分享了python实现名片管理系统的具体代码,供大家参考,具体内容如下系统需求程序启动,显示名片管理系统欢迎界面,并显示功能菜
- Mimesis是一个用于Python的高性能伪数据生成器, 支持多种不同的语言可以用来生成各种测试数据、假的 API 、任意结构的
- 步骤一:下载对应的CURL压缩包并在windows上配置好环境变量进入CURL官网下载对应的windows压缩包。地址:点击打开链接把下载好
- 一、概述全文索引在表中包括一个或多个基于字符的列。这些列可以具有以下任何数据类型:char、varchar、nchar、nvarchar、t