最近做一个全文检索的功能,要求在用户上传附件时获取其内容存入数据库,CSV,EXCEL,WORD,PPT都搞定了。剩余一个最简单的TXT文档,开始忽略了它还有不同编码,导致一些编码格式的文本乱码。兼容写法如下,一个判断文件头的方法搞定所有。
1privateString getCharset(String fileName) throws IOException{ 2 3 BufferedInputStream bin = new BufferedInputStream(newFileInputStream(fileName)); 4 int p = (bin.read() << 8) +bin.read(); 5 6 String code = null; 7 8 switch (p) { 9 case 0xefbb: 10 code = "UTF-8"; 11 break; 12 case 0xfffe: 13 code = "Unicode"; 14 break; 15 case 0xfeff: 16 code = "UTF-16BE"; 17 break; 18 default: 19 code = "GBK"; 20 } 21 return code; 22 } 23 24 25 publicString getTextFromText(String filePath){ 26 27 try { 28 InputStreamReader isr = new InputStreamReader(newFileInputStream(filePath),getCharset(filePath)); 29 BufferedReader br = newBufferedReader(isr); 30 31 StringBuffer sb = new StringBuffer(); 32 String temp = null; 33 while((temp = br.readLine()) != null){ 34 sb.append(temp); 35 } 36 br.close(); 37 return sb.toString(); 38 } catch (FileNotFoundException e) { 39 // TODO Auto-generated catch block 40 e.printStackTrace(); 41 42 }catch (IOException e) { 43 // TODO Auto-generated catch block 44 e.printStackTrace(); 45 } 46 return null; 47 }