Files
langchain/docs/modules/indexes/document_loaders/examples/epub.ipynb
T

2.7 KiB

EPubs

This covers how to load .epub documents into a document format that we can use downstream. You'll need to install the pandocs package for this loader to work.

In [1]:
from langchain.document_loaders import UnstructuredEPubLoader
In [2]:
loader = UnstructuredEPubLoader("winter-sports.epub")
In [3]:
data = loader.load()

Retain Elements

Under the hood, Unstructured creates different "elements" for different chunks of text. By default we combine those together, but you can easily keep that separation by specifying mode="elements".

In [4]:
loader = UnstructuredEPubLoader("winter-sports.epub", mode="elements")
In [5]:
data = loader.load()
In [6]:
data[0]
Out [6]:
Document(page_content='The Project Gutenberg eBook of Winter Sports in\nSwitzerland, by E. F. Benson', lookup_str='', metadata={'source': 'winter-sports.epub', 'page_number': 1, 'category': 'Title'}, lookup_index=0)
In [ ]: