本文所需数据下载地址——>点这里下载
众所周知,葡萄酒的价格是与其品质相关的,本实训根据表中提供的数据对包葡萄酒品质数进行了分析与处理。
| 变量名 | 含义 |
|---|---|
| fixed acidity | 固定酸度 |
| volatile acidity | 挥发性酸度 |
| citric acid | 柠檬酸 |
| residual sugar | 剩余糖 |
| chlorides | 氯化物 |
| free sulfur dioxide | 游离二氧化碳 |
| total sulfur dioxide | 总二氧化碳 |
| density | 密度 |
| PH | 值 |
| sulphates | 酸碱盐 |
| alcohol | 酒精 |
| quality | 品质 |
部分数据:

1、读取数据
1import csv 2f = open("C:/Users/55/Desktop/qweee.csv","r") 3 4reader = csv.reader(f,delimiter = ";") 5data =[] 6for row in reader: 7 data.append(row) 8 9for i in range(5): 10 print(data[i]) 11 12f.close

2、处理数据
(1)查看葡萄酒中总共分为几种品质等级
1qlist = [] 2 3for row in data[1:]: 4 qlist.append(int(row[-1]))######################3rewrefsd 5qcount = set(qlist) 6print("葡萄酒共有%d种等级,分别是:%r"%(len(qcount),qcount))

(2)按白葡萄酒等级将数据集分为7个子集,并统计每种等级的数量
1content_dict = {} 2for row in data[1:]: 3 quality = int(row[-1]) 4 if quality not in content_dict.keys(): 5 content_dict[quality] = [row] 6 else: 7 content_dict[quality].append(row) 8 9for key in content_dict: 10 print(key,":",len(content_dict[key]))

(3)计算每个数据集中 fixed acidity的均值
1mean_list = [] 2for key,value in content_dict.items(): 3 sum = 0 4 for row in value: 5 sum += float(row[0]) 6 7 mean_list.append((key, sum / len(value))) 8for item in mean_list: 9 print(item[0],",", item[1])

将结果用图表的形式展现出来
1import numpy as np 2import matplotlib.pyplot as plt 3key_1 = [] 4a = [] 5for key in content_dict: 6 key_1.append(key) 7 a.append(len(content_dict[key])) 8plt.pie(x=a,labels= key_1) 9plt.show()
