网络机器人概述

网络机器人概述

2026年9月19日·#编程学习/python学习笔记Python/爬虫·974 字 5 分钟
浏览量加载中...
AI 摘要

爬虫的定义与应用场景、工作流程五步、数据清洗,以及 robots 协议(君子协定)的规则字段

什么是网络机器人#

爬虫:也称为网络爬虫(网络机器人),是一种按照一定的预设规则,自动浏览并抓取网络数据的程序或脚本。

常见的应用场景:

场景例子
搜索引擎百度、Google 的网页收录
舆情监控抓取社交平台上的公开讨论做分析
商业分析电商比价系统
AI 大模型训练语料大规模采集公开文本

爬虫的工作流程(五步)#

开始 → 发送HTTP请求 → 解析结果提取数据 → 数据处理(清洗) → 数据存储 → 结束
Note

数据清洗:对采集到的原始数据进行处理、修正、转换和标准化的过程,目的是让数据变得规范、准确。比如把 2h 20m 统一换算成 140 分钟。

robots 协议(君子协定)#

robots 协议也称为爬虫协议、爬虫规则,是指网站根目录下存放的一份文本文件 robots.txt,用于告诉爬虫哪些页面可以抓取、哪些不能抓取。

它叫”君子协定”是因为没有强制力——全凭爬虫自觉遵守。但请务必遵守:网站把它放在那里,就是明确表达了”哪些内容欢迎你来抓”。

一份 robots.txt 长这样(节选自真实网站):

User-agent: * # 通用规则(针对所有爬虫)
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://www.tiobe.com/sitemap_index.xml
Crawl-delay: 5
User-agent: Wandoujia Spider # 特定规则(只针对豌豆荚爬虫)
Disallow: /
User-agent: Mediapartners-Google # 特定规则(只针对谷歌广告爬虫)
Disallow: /subject_search
字段含义
User-agent用户代理,通过这个标识确认爬虫的身份
Disallow不允许访问的资源
Allow允许访问的资源
Sitemap网站地图,帮助爬虫更高效地获取网站内容
Crawl-delay爬取间隔时间(秒),避免频繁访问把网站压垮

相关#

练习题#

一、回忆填空(写完再展开对答案)#

  1. 爬虫是一种按照一定的预设规则,自动浏览并 ____ 网络数据的程序或脚本
  2. 爬虫的五个应用场景:搜索引擎、、商业分析、、……
  3. 工作流程五步:发送 HTTP 请求 → ____ → 数据处理(清洗) → ____
  4. 数据清洗的目的是让数据变得
  5. robots 协议的文件叫 ____,放在网站的 ____ 目录下
  6. robots.txt 五个字段:User-agentSitemap、____
  7. Crawl-delay: 5 的含义是 ____
  8. robots 协议被称为”____ 协议”,因为它没有强制力
填空答案(做完再点开)
  1. 抓取 2. 舆情监控 / AI 大模型训练语料 3. 解析结果提取数据 / 数据存储 4. 规范、准确 5. robots.txt / 根 6. DisallowAllowCrawl-delay 7. 爬取间隔 5 秒(避免频繁访问给网站造成压力) 8. 君子

二、概念自测(口头答得出来即可)#

  • 2-1 爬虫的工作流程五步,按顺序说出来;并解释”数据清洗”为什么要放在”解析”之后
  • 2-2 robots.txt 里 User-agent: * User-agent: Mediapartners-Google 的区别是什么?
  • 2-3 如果你写的爬虫每秒请求目标网站 100 次,违反了 robots.txt 的哪个字段?可能造成什么后果?
参考答案(做完再点开)

2-1 发送 HTTP 请求 → 解析结果提取数据 → 数据处理(清洗) → 数据存储。清洗放在解析之后,因为只有先从网页里把原始数据提取出来,才谈得上修正和标准化。 2-2 * 是通用规则,对所有爬虫生效;指定名字的规则只对那个爬虫生效(比如谷歌广告爬虫)。当规则冲突时,更具体的规则优先。 2-3 违反 Crawl-delay(访问间隔)。后果:给对方服务器造成很大压力,轻则被封 IP / 封 User-Agent,重则影响网站正常用户访问。

评论区

[ 标签 ]
# AI37# AI 编程2# AI工具1# Ajax2# Apifox1# AstrBot3# Astro2# CC Switch1# CDN2# Claude Code1# claudecode2# ClaudeCode1# Cloudflare2# CloudFlare2# CloudFlare-ImgBed3# coc3# CSS6# DeepSeek6# deepseek2# DELETE1# Docker1# EdgeOne3# Gist1# git1# GitHub1# hexo-circle-of-friends1# HTML6# HTTP5# ImageManager1# Java23# java13# JavaScript5# JDBC3# JSON2# JUnit1# LangChain25# Logback1# Maven6# Muse Spark1# Mybatis1# MyBatis4# MySQL28# MySql1# NapCat1# Node.js1# obsidian2# Obsidian5# OpenCode4# ORM1# PathVariable1# PicGo1# PyCharm1# Python65# RequestBody1# RequestMapping1# RESTful风格1# skills1# Slf4j1# SpringBoot11# SQL2# Streamlit5# Svelte2# TailwindCSS1# Telegram3# Tlias2# Vercel1# vscode2# Vue7# Waline3# WebDAV1# Web基础6# Web开发6# WinSCP1# YAML1# 三层架构1# 中二宣言1# 书籍1# 使用文档10# 写作1# 函数2# 刷步数1# 前端32# 动态1# 动漫1# 包1# 单词2# 博客7# 博客工作流1# 博客开发2# 参数接收1# 友链1# 反思2# 图床6# 地图1# 备份2# 大模型1# 奇思妙想1# 存储1# 学习方法6# 学校1# 宝塔面板3# 宝宝10# 对象1# 导航栏1# 工具2# 开发1# 开发工具1# 开发规范1# 开心1# 异常处理1# 影视2# 微信1# 性能优化2# 总结1# 想法15# 感受1# 感悟11# 指南1# 提示词工程1# 插件5# 故障排除1# 效率工具2# 教程10# 数据分析9# 数据库27# 数据结构1# 文件操作2# 斩神1# 日常92# 日志框架1# 朋友圈1# 朱元璋1# 模块1# 模板1# 正则表达式2# 测试1# 游戏2# 爬虫7# 生活迁移1# 电影2# 电脑1# 碎碎念1# 视觉识别1# 类1# 类型注解1# 网络基础2# 网络教室1# 羊毛2# 脚本2# 脚本工具1# 自动化2# 蓝奏云1# 订阅推荐2# 记录2# 评论系统1# 词根1# 词缀1# 说说1# 足迹1# 跑步2# 路径参数1# 转载2# 运动1# 部落冲突1# 配置1# 随机图1# 面向对象5# 音乐3# 音标1# 饮食1# 驼峰命名1# 高德地图1
[ 公告 ]

如果你喜欢,那么欢迎来到我的世界!

了解更多
[ 音乐 ]
封面

音乐

暂未播放

0:000:00
暂无歌词
找不到相关结果。
[ contents ]
[ 全部文章 ]