跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

Python 与 Jupyter Notebook 数据可视化入门教程

Python 数据可视化利用 Matplotlib、Seaborn 等库在 Jupyter Notebook 中实现。文章演示了从环境配置到鸢尾花数据集的完整流程,包括数据加载、清洗、散点图绘制及条形图对比。通过可视化手段揭示特征相关性与品种差异,辅助数据分析决策。

Ne0发布于 2026/3/24更新于 2026/9/1060 浏览
Python 与 Jupyter Notebook 数据可视化入门教程

理解数据与数据可视化的基本流程

数据可视化的核心不仅是将数据映射为图形,而是一个贯穿整个数据流向的完整过程。这个过程可以分为以下几个关键步骤:

  • 数据采集:首先需要收集原始数据,可能来自数据库、API、手动输入或其它形式的文件(如 CSV、Excel 等)。
  • 数据处理和变换:对数据进行清洗、转换、聚合等处理,以便获得可用的数据结构和格式。
  • 可视化映射:将数据映射为图形符号,如点、线、颜色等,展示数据的结构和关系。
  • 人机交互:通过交互式图形实现动态数据探索,用户可以通过缩放、选择、过滤等操作更深入理解数据。
  • 用户感知:最终目标是通过图形呈现帮助用户理解数据的模式、趋势和重要信息。

了解 Python 与其他可视化工具

在数据可视化领域,Python 拥有多个强大的库,可以生成各种类型的图形。常用的库包括:

  • Matplotlib:最基础的可视化库,支持创建各种静态、动态、交互式图形。
  • Seaborn:基于 Matplotlib,提供了更高级和美观的统计图形工具,简化了数据的可视化操作。
  • Pandas:主要是用于数据操作和分析的库,但其内置的可视化功能也非常强大,适合快速生成常见图表。
  • Pyecharts:一个基于 Python 的库,支持创建交互式图形,适合需要精美和复杂展示的场景。

掌握 Anaconda、Jupyter Notebook 的常用操作方法

  • Anaconda:是一个集成数据科学工具的平台,常用于安装和管理 Python 及其相关库。
    • 创建虚拟环境:使用 conda create -n myenv python=3.x 来创建环境。
    • 安装库:在环境中运行 conda install <package> 或 pip install <package>。
  • Jupyter Notebook:是一个交互式编程环境,支持实时代码执行、数据可视化和文档撰写。
    • 在终端输入 jupyter notebook 启动应用,打开浏览器进行操作。
    • 通过 Markdown 格式添加文本注释、公式,方便记录实验过程。

原理

数据可视化的流程可以分为四个主要部分:

  1. 数据采集:收集、导入数据源,通常以 CSV、数据库等形式存在。
  2. 数据处理和变换:利用 Pandas 等工具对数据进行整理。
  3. 可视化映射:借助 Matplotlib、Seaborn 等库创建图形展示。
  4. 交互和感知:通过交互功能(如 Pyecharts)与用户进行数据分析交互,增强对数据的理解。

这种整体的流程不仅提升了可视化的质量,也为用户提供了高效的分析工具。

环境配置

安装 Anaconda 软件,创建实验环境

激活环境:

conda activate myenv 

打开 Anaconda Prompt,创建新的实验环境并指定 Python 版本:

conda create -n myenv python=3.8 

安装 Jupyter Notebook

安装 Jupyter Notebook:

conda install jupyter 

启动 Jupyter Notebook:

jupyter notebook 

创建第一个 Jupyter Notebook 文本

  • 在 Jupyter Notebook 界面中,点击 New -> Python 3,创建一个新的 Notebook 文件。
更改保存路径、重命名文件
  • 创建文件后,可以点击顶部文件名(默认是 Untitled),然后重命名为 Iris Visualization 或其他合适的名字。
创建代码单元和 Markdown 单元
  • 点击 + 按钮可以添加新的单元。
  • 在 Cell 类型的下拉框中,可以选择 Code(代码单元)或 Markdown(文本单元)。
  • 代码单元用来输入 Python 代码,Markdown 单元则可以用来写实验步骤、注释、公式等。

实验 1-1:鸢尾花数据集可视化练习

安装 scikit-learn 库

在 Anaconda Prompt 中运行以下命令安装 scikit-learn 库:

conda install scikit-learn 
导入鸢尾花数据集并绘制表格
代码步骤:
# 导入必要的库
from sklearn import datasets
import pandas as pd
import matplotlib.pyplot as plt

# 设置字体以支持中文显示
plt.rcParams['font.family'] = 'Arial Unicode MS'

# 加载鸢尾花数据集
iris = datasets.load_iris()

# 创建 DataFrame 并设置列名
df = pd.DataFrame(iris.data, columns=['SL', 'SW', 'PL', 'PW'])

# 修改列名为中文
df.columns = ['长度', '宽度', '长度 2', '宽度 2']

# 显示前几行数据
print(df.head())
绘制特征之间的散点图
plt.figure(figsize=(10, 6))
plt.scatter(df['长度'], df['宽度'], c=iris.target, cmap='viridis')
plt.xlabel('花萼长度 (cm)')
plt.ylabel('花萼宽度 (cm)')
plt.title('鸢尾花花萼长度与宽度的散点图')
plt.colorbar(label='种类')
plt.show()
绘制饼图
plt.rcParams['font.family'] = 'Arial Unicode MS'
df['类别'] = iris.target
df_sum = pd.DataFrame(df.groupby('类别').size(), columns=['数量'])
df_sum.plot.pie(y='数量')
条形图:展示每种鸢尾花品种的平均特征值
通过鸢尾花的目标(种类)创建类别列
df['种类'] = pd.Categorical.from_codes(iris.target, iris.target_names)
计算每个品种的平均特征值
mean_values = df.groupby('种类').mean()
绘制条形图 - 展示不同品种的平均花萼长度
plt.figure(figsize=(10, 6))
mean_values['花萼长度'].plot(kind='bar', color=['#4CAF50', '#FF9800', '#2196F3'])
plt.title('不同鸢尾花品种的平均花萼长度')
plt.xlabel('鸢尾花品种')
plt.ylabel('平均花萼长度 (cm)')
plt.xticks(rotation=0)
plt.show()

代码解析

散点图

使用 plt.scatter() 绘制花萼长度与花萼宽度的关系,并根据鸢尾花品种(iris.target)进行颜色映射。 cmap='viridis' 用来指定颜色图,plt.colorbar() 添加颜色图例,显示各个颜色对应的品种。

条形图

使用 groupby('种类') 将鸢尾花数据按种类分类,并计算每种花的平均特征值。 mean_values['花萼长度'].plot(kind='bar') 用于绘制条形图,显示不同品种鸢尾花的平均花萼长度。 color 参数指定了不同品种的颜色,xticks(rotation=0) 保持 x 轴标签不旋转。

结论

散点图提供了特征之间的相关性和品种的分布信息,有助于发现不同品种的分布模式。 条形图则突出展示了不同品种鸢尾花的平均特征值,直观对比它们在某个维度(如花萼长度)上的差异。 这两个可视化方法相结合,有助于从多个角度深入理解鸢尾花数据集中的特征关系和品种差异。

目录

  1. 理解数据与数据可视化的基本流程
  2. 了解 Python 与其他可视化工具
  3. 掌握 Anaconda、Jupyter Notebook 的常用操作方法
  4. 原理
  5. 环境配置
  6. 安装 Anaconda 软件,创建实验环境
  7. 安装 Jupyter Notebook
  8. 创建第一个 Jupyter Notebook 文本
  9. 更改保存路径、重命名文件
  10. 创建代码单元和 Markdown 单元
  11. 实验 1-1:鸢尾花数据集可视化练习
  12. 安装 scikit-learn 库
  13. 导入鸢尾花数据集并绘制表格
  14. 代码步骤:
  15. 导入必要的库
  16. 设置字体以支持中文显示
  17. 加载鸢尾花数据集
  18. 创建 DataFrame 并设置列名
  19. 修改列名为中文
  20. 显示前几行数据
  21. 绘制特征之间的散点图
  22. 绘制饼图
  23. 条形图:展示每种鸢尾花品种的平均特征值
  24. 通过鸢尾花的目标(种类)创建类别列
  25. 计算每个品种的平均特征值
  26. 绘制条形图 - 展示不同品种的平均花萼长度
  27. 代码解析
  28. 散点图
  29. 条形图
  30. 结论

更多推荐文章

查看全部
  • Python AI 大模型部署实战:本地运行、API 服务与 Docker 封装
  • 深入理解 Agent:定义、构建模式与最佳实践
  • C++ 双指针算法实战:有效三角形个数与和为 S 的两个数字
  • OpenClaw 配置 Codex 5.3 搭建个人 AI 编程助手
  • 智能家居中控屏:基于 GLM-4.6V-Flash-WEB 识别家庭成员与习惯
  • GitHub 教育认证通过后如何领取 Copilot Pro
  • OpenClaw 本地部署配置飞书机器人实战
  • IPTV 播放源检测指南:故障排查与智能监测开源方案
  • OpenClaw Web Search 工具配置与官方搜索渠道详解
  • MultiResUNet:重新思考多模态生物医学图像分割的 U-Net 架构
  • Python 生成真随机数的三种安全方式及最佳实践
  • AI 编程工具选型:Copilot、Cursor、Codex 核心差异
  • uni-app 之 设置 tabBar
  • PyTorch 实战:基于文本引导的图像生成与 Stable Diffusion 实践
  • FPGA 视频 4 分屏系统架构详解
  • 删除排序链表中的重复元素 II(链表)
  • System Verilog 硬件验证实战:从基础语法到高级应用
  • 算法实战:前缀和与后缀和解决中心下标及数组乘积问题
  • VS Code 前端开发必备插件推荐:10 款工具提升效率及配置
  • Python YOLOv8 进阶教程

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online