java處理emoji(轉)


最近對接ios、安卓客戶端,需要處理emoji等表情符號,網上總結:

1.過濾掉emoji表情符

2.修改數據庫的編碼格式等,讓其支持存儲emoji

以下分別對兩種方案進行描述:

第一種:過濾掉emoji表情符,統一用*代替
利用emoji的編碼范圍,利用正則匹配過濾:source.replaceAll("[\\ud800\\udc00-\\udbff\\udfff\\ud800-\\udfff]", "*")

private static boolean isNotEmojiCharacter(char codePoint)
{
return (codePoint == 0x0) ||
(codePoint == 0x9) ||
(codePoint == 0xA) ||
(codePoint == 0xD) ||
((codePoint >= 0x20) && (codePoint <= 0xD7FF)) ||
((codePoint >= 0xE000) && (codePoint <= 0xFFFD)) ||
((codePoint >= 0x10000) && (codePoint <= 0x10FFFF));
}
/**
* 過濾emoji 或者 其他非文字類型的字符 
* @param source
* @return
*/
public static String filterEmoji(String source)
{
int len = source.length();
StringBuilder buf = new StringBuilder(len);
for (int i = 0; i < len; i++)
{
char codePoint = source.charAt(i);
if (isNotEmojiCharacter(codePoint))
{
buf.append(codePoint);
} else{

buf.append("*");

}
}
return buf.toString();
}

第二種:修改mysql數據庫的配置,存儲emoji表情符

如果UTF8字符集且是Java服務器的話,當存儲含有emoji表情時,會拋出類似如下異常:

java.sql.SQLException: Incorrect string value: '\xF0\x9F\x92\x94' for column 'name' at row 1       at com.mysql.jdbc.SQLError.createSQLException(SQLError.java:1073)       at com.mysql.jdbc.MysqlIO.checkErrorPacket(MysqlIO.java:3593)       at com.mysql.jdbc.MysqlIO.checkErrorPacket(MysqlIO.java:3525)       at com.mysql.jdbc.MysqlIO.sendCommand(MysqlIO.java:1986)       at com.mysql.jdbc.MysqlIO.sqlQueryDirect(MysqlIO.java:2140)       at com.mysql.jdbc.ConnectionImpl.execSQL(ConnectionImpl.java:2620)       at com.mysql.jdbc.StatementImpl.executeUpdate(StatementImpl.java:1662)       at com.mysql.jdbc.StatementImpl.executeUpdate(StatementImpl.java:1581)

這就是字符集不支持的異常。因為UTF-8編碼有可能是兩個、三個、四個字節,其中Emoji表情是4個字節,有的甚至6個字節,而Mysql的utf8編碼最多3個字節,所以導致了數據插不進去。

升級前需要考慮的問題:

如果你的項目要進行移動產品的用戶文本的存儲,將你的DB字符集從UTF8/GBK等傳統字符集升級到utf8mb4將是勢在必行。你可以通過應用層面轉換emoji等特殊字符,以達到原DB的兼容,我認為可行,但是你可能走了彎路。

utf8mb4作為utf8的super set,完全向下兼容,所以不用擔心字符的兼容性問題。切換中需要顧慮的主要影響是mysql需要重新啟動(雖然mysql官方文檔說可以動態修改配置,但是經過數次測試,還是需要重啟才可生效),對於業務可用率的影響是需要考慮的大問題,這里就暫時不展開討論了。

升級步驟:

1.utf8mb4的最低mysql版本支持版本為5.5.3+,若不是,請升級到較新版本。

mysql版本查看命令請看:查看mysql版本的四種方法;mysql安裝步驟請看:Linux中升級Mysql到Mysql最新版本的方法
2.修改database、table和column字符集。參考以下語句:
ALTER DATABASE database_name CHARACTER SET = utf8mb4 COLLATE = utf8mb4_unicode_ci;
ALTER TABLE table_name CONVERT TO CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;
ALTER TABLE table_name CHANGE column_name VARCHAR(191) CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;
3.修改mysql配置文件my.cnf(windows為my.ini)

my.cnf一般在etc/mysql/my.cnf位置。找到后請在以下三部分里添加如下內容:

[client]
default-character-set = utf8mb4

[mysql]
default-character-set = utf8mb4

[mysqld]
character-set-client-handshake = FALSE
character-set-server = utf8mb4
collation-server = utf8mb4_unicode_ci
init_connect='SET NAMES utf8mb4'

4.重啟 MySQL Server、檢查字符集

1.)重啟命令參考:/etc/init.d/mysql restart

2.)輸入命令:mysql,進入mysql命令行(如果提示沒權限,可以嘗試輸入mysql -uroot -p你的密碼)

3.)在mysql命令行中輸入:SHOW VARIABLES WHERE Variable_name LIKE 'character_set_%' OR Variable_name LIKE 'collation%';

檢查是否如下:

+--------------------------+--------------------+
| Variable_name            | Value              |
+--------------------------+--------------------+
| character_set_client    | utf8mb4            |
| character_set_connection | utf8mb4            |
| character_set_database  | utf8mb4            |
| character_set_filesystem | binary            |
| character_set_results    | utf8mb4            |
| character_set_server    | utf8mb4            |
| character_set_system    | utf8              |
| collation_connection    | utf8mb4_unicode_ci |
| collation_database      | utf8mb4_unicode_ci |
| collation_server        | utf8mb4_unicode_ci |
+--------------------------+--------------------+
rows in set (0.00 sec)

特別說明下:collation_connection/collation_database/collation_server如果是utf8mb4_general_ci,沒有關系。但必須保證character_set_client/character_set_connection/character_set_database/character_set_results/character_set_server為utf8mb4。關於這些字符集配置是干什么用的,有什么區別,請參考:深入Mysql字符集設置

5.如果你用的是java服務器,升級或確保你的mysql connector版本高於5.1.13,否則仍然無法使用utf8mb4
這是mysql官方release note,大家可以查看說明,並下載最新的mysql connector for java的jar包。
這里為大家提供一個:mysql-connector-java-5.1.31-bin.jar
同時記得修改pom配置哦~

6.檢查服務端的db配置文件:

jdbc.driverClassName=com.mysql.jdbc.Driver
jdbc.url=jdbc:mysql://localhost:3306/database?useUnicode=true&characterEncoding=utf8&autoReconnect=true&rewriteBatchedStatements=TRUE
jdbc.username=root
jdbc.password=password

 

特別說明其中的jdbc.url配置:如果你已經升級好了mysql-connector,其中的characterEncoding=utf8可以被自動被識別為utf8mb4(當然也兼容原來的utf8),而autoReconnect配置我強烈建議配上,我之前就是忽略了這個屬性,導致因為緩存緣故,沒有讀取到DB最新配置,導致一直無法使用utf8mb4字符集,多么痛的領悟!!

感謝這位仁兄的分享,順利的幫助我解決了問題,但是我直接拿maven下載的驅動5.1.31還是不好用,后來修改成5.1.13后就沒有問題了。

 

轉自:http://segmentfault.com/blog/ilikewhite/1190000000616820


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM