Python 零基础教程:第一次跑通数据采集、清洗和分析

简介: 本文以JSONPlaceholder公开接口为例,手把手演示Python数据全流程实践:用requests采集文章数据,用pandas清洗(去重、去空、文本规范)、统计(用户发帖量、标题平均长度),强调“边做边学”,避免孤立学语法。代码简洁可运行,附环境配置与工程规范提示。

前段时间,有个刚学 Python 的朋友问我:数据采集、数据清洗、数据分析,到底应该先学哪个?

我的回答是,别拆开学。

单独看教程,很容易变成这种状态:requests 会写两行,pandas 也见过,轮到自己做点东西,还是不知道从哪儿下手。

比较省事的办法,是找一份公开数据,从采集开始,一路做到分析结果。哪怕数据只有一百条,也比背一堆函数有用。

这篇就做一件小事:采集公开的文章数据,清洗掉不方便统计的内容,再看看每个用户发布了多少篇文章。

先把环境装好

电脑上需要有 Python 3。打开终端,输入:

python --version

能看到版本号,就继续安装两个库:

pip install requests pandas

requests 负责取数据,pandas 负责整理数据。新手第一遍不用装太多东西,库越多,报错时越难判断是哪一步的问题。

先看一眼数据从哪儿来

这次用的是 JSONPlaceholder。它是一个供开发和学习使用的公开测试接口,官方指南提供了 /posts 资源,可以直接返回文章列表。

浏览器打开下面这个地址,也能看到原始数据:

https://jsonplaceholder.typicode.com/posts

返回的数据大概是这样:

{
   
  "userId": 1,
  "id": 1,
  "title": "文章标题",
  "body": "文章正文"
}

一条记录有四个字段。我们要做的,就是把这些记录取回来,整理成表格。

第一步,采集数据

新建一个 main.py 文件,先写下面这段:

import requests
import pandas as pd


url = "https://jsonplaceholder.typicode.com/posts"

response = requests.get(url, timeout=10)
response.raise_for_status()

data = response.json()

df = pd.DataFrame(data)

print(df.head())
print(f"一共采集到 {len(df)} 条数据")

运行:

python main.py

如果终端里出现前五条记录,说明采集已经成功。

这里有两个细节我一般不会省。

一个是 timeout=10。网络一直没响应时,程序最多等十秒,不会挂在那里。

另一个是 raise_for_status()。如果接口返回 404、500 之类的错误,程序会直接报出来。否则有时请求明明失败了,后面的代码还在继续跑,排查起来挺绕。

先把原始数据保存下来:

df.to_csv(
    "raw_posts.csv",
    index=False,
    encoding="utf-8-sig"
)

我做采集项目时,原始文件通常不改。清洗错了,还能回来重新处理。要是直接覆盖原始数据,后面发现误删,只能再采一次。

第二步,清洗数据

这份测试数据本身不算脏,不过很适合拿来练几个常用动作:

  • 检查空值;
  • 删除重复记录;
  • 清理文本里的换行和多余空格;
  • 增加后面分析要用的字段。

接着写:

clean_df = df.copy()

print("各字段空值数量:")
print(clean_df.isnull().sum())

clean_df = clean_df.dropna(
    subset=["userId", "id", "title", "body"]
)

clean_df = clean_df.drop_duplicates(
    subset=["id"]
)

clean_df["title"] = (
    clean_df["title"]
    .str.replace(r"\s+", " ", regex=True)
    .str.strip()
)

clean_df["body"] = (
    clean_df["body"]
    .str.replace(r"\s+", " ", regex=True)
    .str.strip()
)

clean_df["title_length"] = (
    clean_df["title"].str.len()
)

clean_df["body_length"] = (
    clean_df["body"].str.len()
)

clean_df.to_csv(
    "clean_posts.csv",
    index=False,
    encoding="utf-8-sig"
)

有些人清洗数据时,一上来就是 dropna(),把带空值的整行全删了。这个习惯不太好。

假设一条文章记录只有正文为空,标题、作者和发布时间都正常,这条数据未必完全没用。删不删,应该看空的是哪个字段,以及它会不会影响当前分析。

这次四个字段都要用,所以才统一过滤。

去重也是一样。这里用 id,因为它是每篇文章的唯一编号。实际做商品采集时,可能要用商品编号;做新闻采集时,也可能要用文章链接加发布时间。不能看到“去重”两个字,就随手把整行重复删掉。

第三步,开始分析

现在来回答几个实际问题:

  • 一共有多少个用户?
  • 每个用户发布了多少篇文章?
  • 哪个用户的平均标题更长?

继续补上代码:

user_count = clean_df["userId"].nunique()

post_count = (
    clean_df.groupby("userId")
    .size()
    .reset_index(name="post_count")
)

avg_title_length = (
    clean_df.groupby("userId")["title_length"]
    .mean()
    .round(1)
    .reset_index(name="avg_title_length")
)

result = post_count.merge(
    avg_title_length,
    on="userId"
)

result = result.sort_values(
    by=["post_count", "avg_title_length"],
    ascending=[False, False]
)

print(f"用户数量:{user_count}")
print(result)

result.to_csv(
    "user_analysis.csv",
    index=False,
    encoding="utf-8-sig"
)

groupby("userId") 可以理解成先把同一个用户的数据放到一组里,再分别统计。

size() 算的是每组有多少行,也就是每个用户有多少篇文章。

后面的 mean() 则是在算每组标题长度的平均值。最后用 merge() 把两份结果拼到一起。

这几行代码看着不多,但已经是一个完整的分析动作了:确定统计对象,选择指标,按用户分组,再合并结果。

完整代码

如果不想分段复制,可以直接运行下面这版:

import requests
import pandas as pd


def collect_data():
    url = "https://jsonplaceholder.typicode.com/posts"

    response = requests.get(url, timeout=10)
    response.raise_for_status()

    return pd.DataFrame(response.json())


def clean_data(df):
    clean_df = df.copy()

    clean_df = clean_df.dropna(
        subset=["userId", "id", "title", "body"]
    )

    clean_df = clean_df.drop_duplicates(
        subset=["id"]
    )

    for column in ["title", "body"]:
        clean_df[column] = (
            clean_df[column]
            .str.replace(r"\s+", " ", regex=True)
            .str.strip()
        )

    clean_df["title_length"] = (
        clean_df["title"].str.len()
    )

    clean_df["body_length"] = (
        clean_df["body"].str.len()
    )

    return clean_df


def analyze_data(df):
    post_count = (
        df.groupby("userId")
        .size()
        .reset_index(name="post_count")
    )

    avg_title_length = (
        df.groupby("userId")["title_length"]
        .mean()
        .round(1)
        .reset_index(name="avg_title_length")
    )

    result = post_count.merge(
        avg_title_length,
        on="userId"
    )

    return result.sort_values(
        by=["post_count", "avg_title_length"],
        ascending=[False, False]
    )


def main():
    raw_df = collect_data()

    raw_df.to_csv(
        "raw_posts.csv",
        index=False,
        encoding="utf-8-sig"
    )

    clean_df = clean_data(raw_df)

    clean_df.to_csv(
        "clean_posts.csv",
        index=False,
        encoding="utf-8-sig"
    )

    result = analyze_data(clean_df)

    result.to_csv(
        "user_analysis.csv",
        index=False,
        encoding="utf-8-sig"
    )

    print(f"原始数据:{len(raw_df)} 条")
    print(f"清洗后数据:{len(clean_df)} 条")
    print(result)


if __name__ == "__main__":
    main()

别急着上爬虫框架

这套代码跑完,你手里会有三个文件:

  • raw_posts.csv:接口返回的原始数据;
  • clean_posts.csv:去重并整理过的数据;
  • user_analysis.csv:最终统计结果。

这已经把采集、清洗和分析串起来了。

后面可以把数据源换成网页,也可以增加图表,但我不建议刚跑通就开始堆多线程、代理池和浏览器自动化。新手最容易踩的坑,不是速度慢,而是采到的数据根本没法用。

先学会保留原始数据,给记录找准唯一标识,再想清楚最后要统计什么。这个习惯养成之后,换一个数据源,无非是采集部分的代码变了,后面的处理思路基本还能接着用。

正式采集其他网站时,也别忘了先查看网站条款和访问要求,只处理公开或已经获得授权的数据,不绕过登录、验证码和明确的访问限制。

相关文章
|
7天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1785 10
|
11天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1643 3
|
12天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
8天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
779 2
|
6天前
|
缓存 测试技术 API
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
DeepSeek V4.1 Flash 内测不用申请,base_url 不变、改个模型名就能调,9/10 到期。本文讲清接入、计费限流与多模态注意点。
803 0
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
|
20天前
|
人工智能 自然语言处理 安全
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
本文聚焦阿里云2026年推出的三款自研AI办公产品,清晰拆解千问办公、Qoder Teams、Qoder CN的差异化定位与能力边界:千问办公主打职场全场景提效,支持自然语言指令一键完成PPT生成、数据分析等高频办公任务;Qoder Teams面向程序员团队,深度整合AI代码生成、团队协同与企业知识库能力;Qoder CN则专为金融、政务等强合规场景打造,实现数据不出境与VPC私有化部署。文章同步给出分场景选型指南与最新活动定价,帮助不同类型的企业按需组合产品,实现业务岗、研发岗与强合规场景的AI能力全覆盖。
3969 5
阿里云千问办公、Qoder Teams、Qoder CN区别与选择指南:模型能力、适用场景与最新活动参考
|
11天前
|
人工智能 自然语言处理 安全
阿里云AI数智鉴密:AI 生成内容如何拿到一张"防篡改的身份证"
隐形水印 + C2PA签名:让AI生成内容“持证上岗”。
1155 0
|
13天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
1519 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
6天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。

热门文章

最新文章