六狼论坛

 找回密码
 立即注册

QQ登录

只需一步,快速开始

新浪微博账号登陆

只需一步,快速开始

搜索
查看: 81|回复: 0

java html标签过滤类

[复制链接]

升级  28.67%

21

主题

21

主题

21

主题

秀才

Rank: 2

积分
93
 楼主| 发表于 2013-1-19 04:13:09 | 显示全部楼层 |阅读模式
import java.util.regex.Matcher;
import java.util.regex.Pattern;
/**
 *   *
 * <p>
 *
 *   * Title: HTML相关的正则表达式工具类   *
 * </p>
 *   *
 * <p>
 *
 *   * Description: 包括过滤HTML标记,转换HTML标记,替换特定HTML标记
 *
 *   *
 * </p>
 *
 *   *
 * <p>
 *
 *   * Copyright: Copyright (c) 2006
 *
 *   *
 * </p>
 *
 *   *
 *
 *   * @author hejian
 *
 *   * @version 1.0
 *
 *   * @createtime 2006-10-16
 *
 *   
 */
public class Substr {
 private final static String regxpForHtml = "<([^>]*)>"; // 过滤所有以<开头以>结尾的标签
 private final static String regxpForImgTag = "<\\s*img\\s+([^>]*)\\s*>"; // 找出IMG标签
 private final static String regxpForImaTagSrcAttrib = "src=\"([^\"]+)\""; // 找出IMG标签的SRC属性
 public Substr() {
 }
 /**
  *   *
  *
  *   * 基本功能:替换标记以正常显示
  *
  *   *
  * <p>
  *
  *   *
  *
  *   * @param input
  *
  *   * @return String
  *
  *   
  */
 public String replaceTag(String input) {
  if (!hasSpecialChars(input)) {
   return input;
  }
  StringBuffer filtered = new StringBuffer(input.length());
  char c;
  for (int i = 0; i <= input.length() - 1; i++) {
   c = input.charAt(i);
   switch (c) {
   case '<':
    filtered.append("<");
    break;
   case '>':
    filtered.append(">");
    break;
   case '"':
    filtered.append(""");
    break;
   case '&':
    filtered.append("&");
    break;
   default:
    filtered.append(c);
   }
  }
  return (filtered.toString());
 }
 /**
  *   *
  *
  *   * 基本功能:判断标记是否存在
  *
  *   *
  * <p>
  *
  *   *
  *
  *   * @param input
  *
  *   * @return boolean
  *
  *   
  */
 public boolean hasSpecialChars(String input) {
  boolean flag = false;
  if ((input != null) && (input.length() > 0)) {
   char c;
   for (int i = 0; i <= input.length() - 1; i++) {
    c = input.charAt(i);
    switch (c) {
    case '>':
     flag = true;
     break;
    case '<':
     flag = true;
     break;
    case '"':
     flag = true;
     break;
    case '&':
     flag = true;
     break;
    }
   }
  }
  return flag;
 }
 /**
  *
  *
  *
  * 基本功能:过滤所有以"<"开头以">"结尾的标签
  *
  * <p>
  *
  *
  *
  * @param str
  *
  * @return String
  */
 public static String filterHtml(String str) {
  Pattern pattern = Pattern.compile(regxpForHtml);
  Matcher matcher = pattern.matcher(str);
  StringBuffer sb = new StringBuffer();
  boolean result1 = matcher.find();
  while (result1) {
   matcher.appendReplacement(sb, "");
   result1 = matcher.find();
  }
  matcher.appendTail(sb);
  return sb.toString();
 }
 /**
  *
  *
  *
  * 基本功能:过滤指定标签
  *
  * <p>
  *
  *
  *
  * @param str
  *
  * @param tag
  *
  *            指定标签
  *
  * @return String
  */
 public static String fiterHtmlTag(String str, String tag) {
  String regxp = "<\\s*" + tag + "\\s+([^>]*)\\s*>";
  Pattern pattern = Pattern.compile(regxp);
  Matcher matcher = pattern.matcher(str);
  StringBuffer sb = new StringBuffer();
  boolean result1 = matcher.find();
  while (result1) {
   matcher.appendReplacement(sb, "");
   result1 = matcher.find();
  }
  matcher.appendTail(sb);
  return sb.toString();
 }
 /**
  *
  *
  *
  * 基本功能:替换指定的标签
  *
  * <p>
  *
  *
  *
  * @param str
  *
  * @param beforeTag
  *
  *            要替换的标签
  *
  * @param tagAttrib
  *
  *            要替换的标签属性值
  *
  * @param startTag
  *
  *            新标签开始标记
  *
  * @param endTag
  *
  *            新标签结束标记
  *
  * @return String
  *
  * @如:替换img标签的src属性值为
  */
 public static String replaceHtmlTag(String str, String beforeTag,
 String tagAttrib, String startTag, String endTag) {
  String regxpForTag = "<\\s*" + beforeTag + "\\s+([^>]*)\\s*>";
  String regxpForTagAttrib = tagAttrib + "=\"([^\"]+)\"";
  Pattern patternForTag = Pattern.compile(regxpForTag);
  Pattern patternForAttrib = Pattern.compile(regxpForTagAttrib);
  Matcher matcherForTag = patternForTag.matcher(str);
  StringBuffer sb = new StringBuffer();
  boolean result = matcherForTag.find();
  while (result) {
   StringBuffer sbreplace = new StringBuffer();
   Matcher matcherForAttrib = patternForAttrib.matcher(matcherForTag
   .group(1));
   if (matcherForAttrib.find()) {
    matcherForAttrib.appendReplacement(sbreplace, startTag
    + matcherForAttrib.group(1) + endTag);
   }
   matcherForTag.appendReplacement(sb, sbreplace.toString());
   result = matcherForTag.find();
  }
  matcherForTag.appendTail(sb);
  return sb.toString();
 }
}
您需要登录后才可以回帖 登录 | 立即注册 新浪微博账号登陆

本版积分规则

快速回复 返回顶部 返回列表