public class FessXpathTransformer extends org.codelibs.fess.crawler.transformer.impl.XpathTransformer implements FessTransformer
| Modifier and Type | Field and Description |
|---|---|
Map<String,String> |
convertUrlMap |
protected FessConfig |
fessConfig |
boolean |
prunedContent |
protected boolean |
useGoogleOffOn |
charsetName, dataClass, fieldRuleMap, trimSpacechildUrlRuleMap, crawlerContainer, defaultEncoding, featureMap, invalidUrlPattern, LOCATION_HEADER, preloadSizeForCharset, propertyMapparentEncodingMap| Constructor and Description |
|---|
FessXpathTransformer() |
| Modifier and Type | Method and Description |
|---|---|
protected void |
addChildUrlFromTagAttribute(List<String> urlList,
URL url,
String attrValue,
String encoding) |
protected List<org.codelibs.fess.crawler.entity.RequestData> |
convertChildUrlList(List<org.codelibs.fess.crawler.entity.RequestData> urlList) |
protected List<String> |
getAnchorList(Document document,
org.codelibs.fess.crawler.entity.ResponseData responseData) |
protected Integer |
getAttributeAsInteger(NamedNodeMap attributes,
String name) |
protected URL |
getBaseUrl(String currentUrl,
String baseHref) |
protected String |
getCanonicalUrl(org.codelibs.fess.crawler.entity.ResponseData responseData,
Document document) |
protected String |
getContentXpath(FessConfig fessConfig,
Map<String,String> xpathConfigMap) |
Object |
getData(org.codelibs.fess.crawler.entity.AccessResultData<?> accessResultData) |
protected String |
getDigestXpath(FessConfig fessConfig,
Map<String,String> xpathConfigMap) |
FessConfig |
getFessConfig() |
protected String |
getLangXpath(FessConfig fessConfig,
Map<String,String> xpathConfigMap) |
org.slf4j.Logger |
getLogger() |
protected String |
getMultipleNodeValue(Document document,
String xpath) |
protected String |
getSingleNodeValue(Document document,
String xpath,
boolean pruned) |
protected String |
getThumbnailSrc(String url,
NamedNodeMap attributes) |
protected String |
getThumbnailUrl(org.codelibs.fess.crawler.entity.ResponseData responseData,
Document document) |
protected URL |
getURL(String currentUrl,
String url) |
void |
init() |
protected boolean |
isPrunedTag(Node node) |
protected boolean |
isValidCanonicalUrl(String url,
String canonicalUrl) |
protected boolean |
isValidUrl(String urlStr) |
protected String |
normalizeCanonicalUrl(String baseUrl,
String canonicalUrl) |
protected void |
parseTextContent(Node node,
StringBuilder buf) |
protected Node |
processGoogleOffOn(Node node,
org.codelibs.core.misc.ValueHolder<Boolean> flag) |
protected void |
processMetaRobots(org.codelibs.fess.crawler.entity.ResponseData responseData,
org.codelibs.fess.crawler.entity.ResultData resultData,
Document document) |
protected Node |
pruneNode(Node node) |
protected void |
putAdditionalData(Map<String,Object> dataMap,
org.codelibs.fess.crawler.entity.ResponseData responseData,
Document document) |
protected String |
removeCommentTag(String content) |
protected String |
replaceDuplicateHost(String url) |
void |
setUseGoogleOffOn(boolean useGoogleOffOn) |
protected void |
storeData(org.codelibs.fess.crawler.entity.ResponseData responseData,
org.codelibs.fess.crawler.entity.ResultData resultData) |
addFieldRule, getAdditionalData, getCharsetName, getDataClass, getFieldRuleMap, getResultDataBody, getResultDataBody, getResultDataFooter, getResultDataHeader, isTrimSpace, setCharsetName, setDataClass, setFieldRuleMap, setTrimSpace, trimSpaceaddChildUrlRule, addFeature, addProperty, encodeUrl, getBaseHref, getChildUrlRuleMap, getDefaultEncoding, getDomParser, getDuplicateUrl, getFeatureMap, getInvalidUrlPattern, getPreloadSizeForCharset, getPropertyMap, getUrlFromTagAttribute, getXPathAPI, isHtml, isSupportedCharset, isValidPath, loadCharset, normalizeEncoding, normalizeUrl, parseCharset, setChildUrlRuleMap, setDefaultEncoding, setFeatureMap, setInvalidUrlPattern, setPreloadSizeForCharset, setPropertyMap, storeChildUrls, transform, updateCharsetgetName, setNameclone, equals, finalize, getClass, hashCode, notify, notifyAll, toString, wait, wait, waitdecodeUrlAsName, evaluateValue, getFileName, getHost, getMaxSiteLength, getParentEncoding, getSite, putResultDataBody, putResultDataWithTemplatepublic boolean prunedContent
protected FessConfig fessConfig
protected boolean useGoogleOffOn
@PostConstruct public void init()
public FessConfig getFessConfig()
getFessConfig in interface FessTransformerpublic org.slf4j.Logger getLogger()
getLogger in interface FessTransformerprotected void storeData(org.codelibs.fess.crawler.entity.ResponseData responseData,
org.codelibs.fess.crawler.entity.ResultData resultData)
storeData in class org.codelibs.fess.crawler.transformer.impl.XpathTransformerprotected void processMetaRobots(org.codelibs.fess.crawler.entity.ResponseData responseData,
org.codelibs.fess.crawler.entity.ResultData resultData,
Document document)
protected boolean isValidUrl(String urlStr)
protected void putAdditionalData(Map<String,Object> dataMap, org.codelibs.fess.crawler.entity.ResponseData responseData, Document document)
protected String getLangXpath(FessConfig fessConfig, Map<String,String> xpathConfigMap)
protected String getContentXpath(FessConfig fessConfig, Map<String,String> xpathConfigMap)
protected String getDigestXpath(FessConfig fessConfig, Map<String,String> xpathConfigMap)
protected String getCanonicalUrl(org.codelibs.fess.crawler.entity.ResponseData responseData, Document document)
protected String getSingleNodeValue(Document document, String xpath, boolean pruned)
protected void parseTextContent(Node node, StringBuilder buf)
protected Node processGoogleOffOn(Node node, org.codelibs.core.misc.ValueHolder<Boolean> flag)
protected boolean isPrunedTag(Node node)
protected List<String> getAnchorList(Document document, org.codelibs.fess.crawler.entity.ResponseData responseData)
protected URL getBaseUrl(String currentUrl, String baseHref) throws MalformedURLException
MalformedURLExceptionprotected List<org.codelibs.fess.crawler.entity.RequestData> convertChildUrlList(List<org.codelibs.fess.crawler.entity.RequestData> urlList)
convertChildUrlList in class org.codelibs.fess.crawler.transformer.impl.HtmlTransformerpublic Object getData(org.codelibs.fess.crawler.entity.AccessResultData<?> accessResultData)
getData in interface org.codelibs.fess.crawler.transformer.TransformergetData in class org.codelibs.fess.crawler.transformer.impl.XpathTransformerprotected void addChildUrlFromTagAttribute(List<String> urlList, URL url, String attrValue, String encoding)
addChildUrlFromTagAttribute in class org.codelibs.fess.crawler.transformer.impl.HtmlTransformerpublic void setUseGoogleOffOn(boolean useGoogleOffOn)
protected String getThumbnailUrl(org.codelibs.fess.crawler.entity.ResponseData responseData, Document document)
protected String getThumbnailSrc(String url, NamedNodeMap attributes)
protected Integer getAttributeAsInteger(NamedNodeMap attributes, String name)
protected URL getURL(String currentUrl, String url) throws MalformedURLException
MalformedURLExceptionCopyright © 2009–2017 CodeLibs. All rights reserved.