python数据可视化Seaborn绘制山脊图
作者:赵卓不凡? 发布时间:2023-12-22 09:04:17
1. 引言
山脊图一般由垂直堆叠的折线图组成,这些折线图中的折线区域间彼此重叠,此外它们还共享相同的x轴.
山脊图经常以一种相对不常见且非常适合吸引大家注意力的紧凑图的形式表现。观察上图,我们给其起名叫Ridge plot是
非常恰当的,因为上述图表看起来确实很像山的脊背.此外,上述图像还有另一个称呼叫做Joy Plots–这主要是因为Joy Division
乐队在如下专辑封面上采用了这种可视化形式.
2. 举个栗子
在介绍完山脊图的由来背景后,现在让我们来举个例子。我们使用以下数据集,主要包含 Netflix
的作品及对应的 IMDB
分数。
import matplotlib.pyplot as plt
import seaborn as sns
import pandas as pd
df = pd.read_csv('./data/film.csv')
languages = ['English', 'Hindi', 'Spanish',
'French', 'Italian', 'Portuguese']
df_filtered = df[df['Language'].isin(languages)]
df_filtered
运行结果如下:
上表中从左往右,依次为ID,电影名称,电影类型,首映日期,电影长度,IMDB评分,以及电影语种.
接下来我们首先使用 Seaborns FacetGrid
库来为每个语言类别的电影创建不同IMDB下的概率密度分布曲线图。实现这个功能很简单,仅需要对数据表中相应名称字段来按值进行分组统计即可。
代码如下:
sns.set_theme(style="white")
g = sns.FacetGrid(df_filtered, row="Language")
g.map_dataframe(sns.kdeplot, x="IMDB Score")
g.set(ylabel="")
结果如下:
上述实现采用的为默认的参数配置,横轴表示IMDB
分数,纵轴表示对应不同语种电影在不同IMDB得分下的概率. 从上述图例中可以看出单个语种电影评分的概率密度分布,但是很难查看不同语种间的对比分布。
接着我们尝试来改进显示效果,我们通过设置FacetGrid
函数中相应的参数来让图表变得更宽更短。
代码如下:
sns.set_theme(style="white")
g = sns.FacetGrid(df_filtered, row="Language", aspect=9, height=1.2)
g.map_dataframe(sns.kdeplot, x="IMDB Score")
g.set(ylabel="")
结果如下:
上述改进虽然可以让数据间的对比变得明显一些,但是这个可视化从视觉效果上看并没有太大的吸引力。
观察上图,我们其实并没有多少人去关注左侧的Y轴信息,我们更关注的是数据的形状.这就意味着我们这里可以删除Y轴.
代码如下:
sns.set_theme(style="white")
g = sns.FacetGrid(df_filtered, row="Language", aspect=9, height=1.2)
g.map_dataframe(sns.kdeplot, x="IMDB Score")
g.set_titles("")
g.set(yticks=[],ylabel="")
g.despine(left=True)
运行结果如下:
3.山脊图
经过我们的优化,上述不同语种电影的IMDB
得分概率密度分布还是不够直观.
接下来我们一步一步来介绍我们的终结法宝–山脊图.
首先,我们需要确保背景是透明的。
sns.set_theme(style="white", rc={"axes.facecolor": (0, 0, 0, 0)})
接着,我们需要填充线条的内部区域。
g.map_dataframe(sns.kdeplot, x="IMDB Score", fill=True, alpha=1)
上述操作后,不同语种间的区域会出现重叠,这时我们还需要区分重叠部分。
我们通过以下代码进行区分:
sns.set_theme(style="white", rc={"axes.facecolor": (0, 0, 0, 0)})
g = sns.FacetGrid(df_filtered, row="Language", aspect=9, height=1.2)
g.map_dataframe(sns.kdeplot, x="IMDB Score", fill=True, alpha=1)
g.map_dataframe(sns.kdeplot, x="IMDB Score", color='black')
g.fig.subplots_adjust(hspace=-.5)
g.set_titles("")
g.set(yticks=[])
g.despine(left=True)
运行结果如下:
到目前位置,我们实现了我们第一版的山脊图,接着我们可以根据需要来自定义扩展它。FacetGrid
函数非常适合创建多个可视化图例,并且 .map 和 .map_dataframe
方法可以让我们与所有子图进行交互。
代码如下:
sns.set_theme(style="white", rc={"axes.facecolor": (0, 0, 0, 0), 'axes.linewidth':2})
palette = sns.color_palette("Set2", 12)
g = sns.FacetGrid(df_filtered, palette=palette, row="Language", hue="Language", aspect=9, height=1.2)
g.map_dataframe(sns.kdeplot, x="IMDB Score", fill=True, alpha=1)
g.map_dataframe(sns.kdeplot, x="IMDB Score", color='black')
def label(x, color, label):
ax = plt.gca()
ax.text(0, .2, label, color='black', fontsize=13,
ha="left", va="center", transform=ax.transAxes)
g.map(label, "Language")
g.fig.subplots_adjust(hspace=-.5)
g.set_titles("")
g.set(yticks=[], xlabel="IMDB Score")
g.despine( left=True)
plt.suptitle('Netflix Originals - IMDB Scores by Language', y=0.98)
运行结果如下:
4.扩展
最后,我们可以使用下面代码来复制Joy Division
专辑封面的可视化效果。
代码如下:
import pandas as pd
import seaborn as sns
import matplotlib.pyplot as plt
if __name__ == "__main__":
url = "./data/pulsar.csv"
df = pd.read_csv(url, header=None)
df = df.stack().reset_index()
df.columns = ['idx', 'x', 'y']
sns.set_theme(rc={"axes.facecolor": (0, 0, 0, 0), 'figure.facecolor':'#000000', 'axes.grid':False})
g = sns.FacetGrid(df, row='idx', aspect=50, height=0.4)
# Draw the densities in a few steps
g.map(sns.lineplot, 'x', 'y', clip_on=False, alpha=1, linewidth=1.5)
g.map(plt.fill_between, 'x', 'y', color='#000000')
g.map(sns.lineplot, 'x', 'y', clip_on=False, color='#ffffff', lw=2)
# Set the subplots to overlap
g.fig.subplots_adjust(hspace=-0.95)
g.set_titles("")
g.set(yticks=[], xticks=[], ylabel="", xlabel="")
g.despine(bottom=True, left=True)
plt.savefig('joy.png', facecolor='#000000')
运行结果如下:
5.结论
总的来说,山脊图非常适合关注数据的分布对比。山脊图以吸引人的美学可以引起观众的共鸣,使它们成为向用户介绍数据分布对比分析时的绝佳选择。
来源:https://blog.csdn.net/sgzqc/article/details/121911883
猜你喜欢
- 本文实例为大家分享了python爬虫爬取淘宝商品的具体代码,供大家参考,具体内容如下1、需求目标 : 进去淘宝页面,搜索耐克关键词,抓取 商
- 简介集合对象 set 是由具有唯一性的可哈希对象组成的无序多项集,如 list 不能哈希因此,不能作为 set 的一项。set 的常见用途包
- 今天从网上学习了有关SQL注入的基本技能。SQL注入的重点就是构造SQL语句,只有灵活的运用SQL 语句才能构造出牛比的注入字符串。学完之后
- 这篇文章主要介绍了如何使用Python多线程测试并发漏洞,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的
- 下面两个函数实现了对字符串中数字的判断。function isnaw(str) f
- 我就废话不多说了,大家还是直接看代码吧~#zmail库:可以用几行代码帮我们收取一封邮件import zmail#输入账号和密码server
- 介绍本期案例是带着大家制作一个属于自己的GUI图形化界面—>用于设计签名的哦(效果如下图),是不是感觉很好玩,是不
- 如何为XHTML做好准备,XHTML与HTML 4.01标准没有太多的不同。所以将你的代码升级至4.01是个不错的开始。HTML 4.01参
- 这篇文章主要介绍了如何基于Python制作有道翻译小工具,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的
- 模型VGG,数据集cifar。对照这份代码走一遍,大概就知道整个pytorch的运行机制。 来源 定义模型:'''V
- 回滚段管理一直是ORACLE数据库管理的一个难题,本文通过实例介绍ORACLE回滚段的概念,用法和规划及问题的解决。 回滚段概述 回滚段用于
- 我们主要讲解一下利用Python实现感知机算法。算法一首选,我们利用Python,按照上一节介绍的感知机算法基本思想,实现感知算法的原始形式
- BeautifulSoup是Python的一个第三方库,可用于帮助解析html/XML等内容,以抓取特定的网页信息。目前最新的是
- 安装pip(3) install pyecharts此文版本为v1.6此文版本为v1.6此文版本为v1.6效果图使用Pycharts绘制一个
- window.onload=function() {&
- 本文实例讲述了Python基于回溯法子集树模板解决m着色问题。分享给大家供大家参考,具体如下:问题图的m-着色判定问题给定无向连通图G和m种
- 使用Keras训练好的模型用来直接进行预测,这个时候我们该怎么做呢?【我这里使用的就是一个图片分类网络】现在让我来说说怎么样使用已经训练好的
- 设置MySQL数据同步(单向&双向)由于公司的业务需求,需要网通和电信的数据同步,就做了个MySQL的双向同步,记下过程,以后用得到
- Mac安装python3环境首先我先给说明一下:我也是初次接触python,有一定的Java基础,对编程语法有一定基础,当然小菜在这里全当小
- python画分布图代码示例:# encoding=utf-8import matplotlib.pyplot as pltfrom pyl