招投标信息采集与搜索(实习)
用 Python 从 5 个政务站点采集公告,清洗入库后做成可检索站点。
我的角色:智慧广电实习 · 多源爬虫取数为主,并参与检索站点部分开发 / 测试 / 部署。
把 5 个信息源的招投标公告采集入库,做成可检索、可筛选、可导出 CSV 的搜索站点。
- 5 个站点采集来源政府采购 / 公共资源 / 邮政等
- 约 9000+ 条联调库规模验收截图最高约 9321
- 676 条页内样例公开公告导出子集
- 目标网站 · 5 站
- Python 爬虫
- 清洗入库
- 搜索 · 筛选导出
侧重点
同一案例,可按分析或交付侧重点查看
- 主线:5 站采集 → 清洗入库 → 检索 / 筛选 / 导出。
- 证据:联调截图(约 9000+)+ 676 条公开公告样例。
- 完成联调验收,未长期正式运营。
- 说明数据从哪来、如何可查;用户结构专题见套餐页。
- 样例字段:标题、时间、来源、关键词。
核心发现
-
多源站点要分别适配
各站字段与反爬不同:简单站用 requests + BeautifulSoup,复杂站用 Playwright(广东站含验证码 OCR)。
覆盖 5 个公开信息源;联调截图与页内样例证明可入库、可检索。
-
采集结果进入检索站
标题、时间、来源、关键词入库后,支持检索、筛选、CSV 导出与手动触发爬取。
截图为联调环境(约 8600+ / 9321);页内表为 676 条公开公告子集。
分析图库
招投标搜索首页:关键词、快捷词、日期与来源筛选、导出 CSV
说明 入库后可在站内检索;该帧约 8600+,与联调约 9000+ 同量级。
局限 联调环境截图,非公网可登录站;条数随爬取变化。
下一步 下方样例表演示同一套字段(标题 / 时间 / 来源 / 关键词)。
标讯样例检索
公开公告样例 · 676 条 · 按来源 / 关键词过滤(联调库约 9000+ 见截图)
加载中…
| 标题 | 发布时间 | 来源 | 关键词 |
|---|
功能模块
检索能力说明 · 证据见上方截图与样例表
关键词检索
支持标题关键词检索,以及任意匹配 / 全部匹配;首页提供专线、短信、政务云、广东等快捷关键词,降低业务侧记忆成本。
条件筛选
可按起止日期、网站来源筛选,并按时间升降序查看;筛空时给出可理解的空态,而不是空白页。
结果列表
列表对齐业务阅读习惯:标题、发布时间、来源站点与命中关键词一眼可见,减少反复点开详情。
导出与更新
支持导出 CSV;可手动触发爬取并查看运行状态(见联调截图)。
案例说明
背景
招投标信息分散在多个政务公开站点。实习于广东智慧广电物联网科技有限公司(2025.08–2025.12),参与 招投标信息采集与搜索:以 Python 多源爬虫 为主,清洗入库后做成可检索站点,并参与部分开发 / 测试 / 部署。完成联调验收,未长期正式运营。同期用户结构专题见 广电用户场景 · 套餐与在网分析。
我做了什么
- 多源采集(重点):覆盖中国政府采购网、广东政府采购网、公共资源交易平台等 5 站;简单站
requests+ BeautifulSoup,复杂站 Playwright(广东站含验证码 OCR)。 - 清洗入库:统一标题、时间、来源、关键词等字段。
- 检索站点:参与检索、筛选、列表、CSV 导出与爬取更新等模块的开发、测试与部署。
- 范围:止于采集与检索。本页不贴可跑通整仓代码。
本页提供什么
- 采集链路与多源适配说明
- 联调 UI 截图(约 8600+ / 9321)
- 676 条公开公告样例检索
局限
未长期正式运营;页内为公开公告样例(非联调全量)。脚本密钥已剥离。
实习项目。约 9000+ 为联调验收截图规模(最高约 9321);页内 676 条为公开公告导出子集。脚本密钥已剥离,非可再跑通工程。未长期正式运营。