正则表达式,从富文本中提取纯文本


Java 使用正则表达式,从HTML富文本中提取纯文本。

public class demo {

    /**
     * 富文本提取纯文本
     * @param inputStr
     * @return
     */
    private static String htmlTagFilter(String inputStr) {
        if (inputStr == null || "".equals(inputStr.trim())) {
            return "";
        }
        String outStr = inputStr.replaceAll("\\&[a-zA-Z]{1,10};", "")
                .replaceAll("<[a-zA-Z]+[1-9]?[^><]*>", "")
                .replaceAll("", "")
                .replaceAll("\\s*|\t|\r|\n", "");
        return outStr;
    }

    public static void main(String[] args) {
        System.out.println(
            htmlTagFilter("

\n" + "\t在电影院开展观影活动。\n" + "

\n" + "

\n" + "\t在欢乐的气氛中,愉快地度过节日。\n" + "

\n" + "

\n" + "\t\"\"
\n" + "
\n" + "

") ); } }

输出结果:在电影院开展观影活动。在欢乐的气氛中,愉快地度过节日。

心灵笔记:

孩子问我,上班和上学哪一个更辛苦,这让我也不知道该如何回答。

直到我见到一群干着辛苦工作,却有说有笑的人们,我才知道,

不高兴了最辛苦!