HTML zu LaTex: Wie kann ich Python und lxml verwenden, um ein HTML-Dokument mit benutzerdefinierten Makros in LaTeX zu konvertieren?

HTML zu LaTex: Wie kann ich Python und lxml verwenden, um ein HTML-Dokument mit benutzerdefinierten Makros in LaTeX zu konvertieren?

Ich möchte Python verwenden, um HTML5-Dokumente mit einem bekannten Satz von Tags zu nehmen und sie für den qualitativ hochwertigen Ausdruck mithilfe angepasster LaTeX-Makros in LaTeX zu konvertieren.

Antwort1

Ich habe mir viele Tools angesehen und mich für lxml mit einer rekursiven Funktion entschieden, um HTML-Tags in LaTeX-Markup zuzuordnen. Damit haben Sie einen einzigen Ort, an dem Sie Ihre Zuordnung mit Python einfach definieren können. Ich glaube, ich habe anhand eines Beispiels im Buch gearbeitet,Grundlagen der Python-Netzwerkprogrammierung

Hier ist ein minimal funktionierendes Beispiel in Python 2.7:

# convert html document to LaTeX
import lxml.html # http://lxml.de/lxmlhtml.html
from lxml import etree
from io import StringIO, BytesIO

def html2latex(el): # fill in this function to catch and convert html tags
    result = []
    if el.text:
        result.append(el.text)
    for sel in el:
        if False: # get info
            print('tag',sel.tag)
            print('text',sel.text)
            print('tail',sel.tail)
            print('attrib',sel.attrib)
        if sel.tag in ["h1"]:
            result.append('\hmchapter{%s}' % html2latex(sel))
        elif sel.tag in ["td", "table"]:
            result.append("<%s>" % sel.tag)
            result.append(html2latex(sel))
            result.append("</%s>" % sel.tag)
        elif sel.tag in ["span"]:  #
            for att in sel.attrib.keys():
                if att =='style':
                    if sel.attrib[att] == 'font-style:italic':
                        result.append(r'\textit{%s}' % (html2latex(sel)))
        else:
            result.append(html2latex(sel))
        if sel.tail:
            result.append(sel.tail)
    return "".join(result)

def main():
    # must be unicode or lxml parse crashes
    html = u'''
<!DOCTYPE html>
    <html>
  <head>
    <title></title>
  </head>
<body >
  <h1 class="hmchapter" data-hmvarbodychaptertitle = "My title">My title</h1>
  text <span style="font-style:italic">in a specific context</span> and more.
</body>
</html>
'''
    parser = etree.HTMLParser()
    tree   = etree.parse(StringIO(html), parser) # expects a file, use StringIO for string
    root = tree.getroot()
    latex = html2latex(root)
    print latex

if __name__ == '__main__':
    main()

welches druckt:

\hmchapter{My title}
text \textit{in a specific context} and more.

verwandte Informationen