我在一个字符串中有一个完整的XML文档,并且想要一个Document
对象.谷歌出现了各种各样的垃圾.什么是最简单的解决方案?(在Java 1.5中)
解决方案感谢Matt McMinn,我已经确定了这个实现.它具有适当级别的输入灵活性和异常粒度.(很高兴知道错误是来自格式错误的XML SAXException
- 或者只是错误的IO - IOException
.)
public static org.w3c.dom.Document loadXMLFrom(String xml) throws org.xml.sax.SAXException, java.io.IOException { return loadXMLFrom(new java.io.ByteArrayInputStream(xml.getBytes())); } public static org.w3c.dom.Document loadXMLFrom(java.io.InputStream is) throws org.xml.sax.SAXException, java.io.IOException { javax.xml.parsers.DocumentBuilderFactory factory = javax.xml.parsers.DocumentBuilderFactory.newInstance(); factory.setNamespaceAware(true); javax.xml.parsers.DocumentBuilder builder = null; try { builder = factory.newDocumentBuilder(); } catch (javax.xml.parsers.ParserConfigurationException ex) { } org.w3c.dom.Document doc = builder.parse(is); is.close(); return doc; }
erickson.. 148
哇那里!
此代码存在潜在的严重问题,因为它忽略了String
(默认情况下为UTF-8)中指定的字符编码.当您调用String.getBytes()
平台时,默认编码用于将Unicode字符编码为字节.因此,解析器可能会认为它获得了UTF-8数据,而事实上它正在获得EBCDIC或其他东西......不是很漂亮!
相反,使用带有InputSource的parse方法,该方法可以使用Reader构造,如下所示:
import java.io.StringReader; import org.xml.sax.InputSource; … return builder.parse(new InputSource(new StringReader(xml)));
这可能看起来不是什么大不了的事,但对字符编码问题的无知会导致阴险代码腐烂类似于y2k.
哇那里!
此代码存在潜在的严重问题,因为它忽略了String
(默认情况下为UTF-8)中指定的字符编码.当您调用String.getBytes()
平台时,默认编码用于将Unicode字符编码为字节.因此,解析器可能会认为它获得了UTF-8数据,而事实上它正在获得EBCDIC或其他东西......不是很漂亮!
相反,使用带有InputSource的parse方法,该方法可以使用Reader构造,如下所示:
import java.io.StringReader; import org.xml.sax.InputSource; … return builder.parse(new InputSource(new StringReader(xml)));
这可能看起来不是什么大不了的事,但对字符编码问题的无知会导致阴险代码腐烂类似于y2k.
这在Java 1.5中适用于我 - 我删除了可读性的特定异常.
import javax.xml.parsers.DocumentBuilderFactory; import javax.xml.parsers.DocumentBuilder; import org.w3c.dom.Document; import java.io.ByteArrayInputStream; public Document loadXMLFromString(String xml) throws Exception { DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance(); factory.setNamespaceAware(true); DocumentBuilder builder = factory.newDocumentBuilder(); return builder.parse(new ByteArrayInputStream(xml.getBytes())); }
刚出现类似的问题,除了我需要一个NodeList而不是一个Document,这就是我想出的.它与以前的解决方案大致相同,扩充以将根元素作为NodeList获取并使用erickson建议使用InputSource代替字符编码问题.
private String DOC_ROOT="root"; String xml=getXmlString(); Document xmlDoc=loadXMLFrom(xml); Element template=xmlDoc.getDocumentElement(); NodeList nodes=xmlDoc.getElementsByTagName(DOC_ROOT); public static Document loadXMLFrom(String xml) throws Exception { InputSource is= new InputSource(new StringReader(xml)); DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance(); factory.setNamespaceAware(true); DocumentBuilder builder = null; builder = factory.newDocumentBuilder(); Document doc = builder.parse(is); return doc; }