1. 报错详情¶
现象:graph.view()展示的图形显示中文为乱码。
In [40]:
1from sklearn import tree 2from sklearn.datasets import load_wine 3from sklearn.model_selection import train_test_split 4wine = load_wine() 5Xtrain, Xtest, Ytrain, Ytest = train_test_split(wine.data,wine.target,test_size=0.3) 6clf = tree.DecisionTreeClassifier(criterion="entropy") 7clf = clf.fit(Xtrain, Ytrain) 8score = clf.score(Xtest, Ytest) 9feature_name = ['酒精','苹果酸','灰','灰的碱性','镁','总酚','类黄酮','非黄烷类酚类','花青素','颜色强度','色调','od280/od315稀释葡萄酒','脯氨酸']
In [41]:
1import graphviz 2dot_data = tree.export_graphviz(clf 3 ,out_file = None 4 ,feature_names = feature_name 5 ,class_names=["琴酒","雪莉","贝尔摩德"] 6 ,filled=True 7 ,rounded=True 8 9) 10graph = graphviz.Source(dot_data) 11graph.view()
Out[41]:
'Source.gv.pdf'
2 解决原理¶
修改编码方式为UTF-8,替换字体为仿宋。
3 解决方案¶
(1)解决方法一:
In [42]:
1import graphviz 2dot_data = tree.export_graphviz(clf 3 ,out_file = 'tree.dot' 4 ,feature_names = feature_name 5 ,class_names=["琴酒","雪莉","贝尔摩德"] 6 ,filled=True 7 ,rounded=True 8 9) 10with open("tree.dot",encoding='utf-8') as f: 11 dot_graph = f.read() 12graph=graphviz.Source(dot_graph.replace("helvetica","FangSong")) 13graph.view()
Out[42]:
'Source.gv.pdf'
(2)解决方法二:
In [43]:
1import graphviz 2dot_data = tree.export_graphviz(clf 3 ,out_file = None 4 ,feature_names = feature_name 5 ,class_names=["琴酒","雪莉","贝尔摩德"] 6 ,filled=True 7 ,rounded=True 8 9) 10graph = graphviz.Source(dot_data.replace("helvetica","FangSong").encode(encoding='utf-8')) 11graph.view()
Out[43]:
'Source.gv.pdf'
两者原理是相同的,根据是否需要输出dot文件可选择使用方式。