Files
langchain/docs/modules/indexes/document_loaders/examples/imsdb.ipynb
T
Leonid Ganeline 59204a5033 docs: document_loaders improvements (#4200)
- made notebooks consistent: titles, service/format descriptions.
- corrected short names to full names, for example, `Word` -> `Microsoft
Word`
- added missed descriptions
- renamed notebook files to make ToC correctly sorted
2023-05-05 17:44:54 -07:00

2.7 KiB

IMSDb

IMSDb is the Internet Movie Script Database.

This covers how to load IMSDb webpages into a document format that we can use downstream.

In [1]:
from langchain.document_loaders import IMSDbLoader
In [2]:
loader = IMSDbLoader("https://imsdb.com/scripts/BlacKkKlansman.html")
In [3]:
data = loader.load()
In [8]:
data[0].page_content[:500]
Out [8]:
'\n\r\n\r\n\r\n\r\n                                    BLACKKKLANSMAN\r\n                         \r\n                         \r\n                         \r\n                         \r\n                                      Written by\r\n\r\n                          Charlie Wachtel & David Rabinowitz\r\n\r\n                                         and\r\n\r\n                              Kevin Willmott & Spike Lee\r\n\r\n\r\n\r\n\r\n\r\n\r\n\r\n\r\n                         FADE IN:\r\n                         \r\n          SCENE FROM "GONE WITH'
In [6]:
data[0].metadata
Out [6]:
{'source': 'https://imsdb.com/scripts/BlacKkKlansman.html'}