mirror of
https://github.com/langchain-ai/langchain.git
synced 2026-10-11 20:35:14 +03:00
- made notebooks consistent: titles, service/format descriptions. - corrected short names to full names, for example, `Word` -> `Microsoft Word` - added missed descriptions - renamed notebook files to make ToC correctly sorted
2.7 KiB
2.7 KiB
In [1]:
from langchain.document_loaders import IMSDbLoaderIn [2]:
loader = IMSDbLoader("https://imsdb.com/scripts/BlacKkKlansman.html")In [3]:
data = loader.load()In [8]:
data[0].page_content[:500]Out [8]:
'\n\r\n\r\n\r\n\r\n BLACKKKLANSMAN\r\n \r\n \r\n \r\n \r\n Written by\r\n\r\n Charlie Wachtel & David Rabinowitz\r\n\r\n and\r\n\r\n Kevin Willmott & Spike Lee\r\n\r\n\r\n\r\n\r\n\r\n\r\n\r\n\r\n FADE IN:\r\n \r\n SCENE FROM "GONE WITH'
In [6]:
data[0].metadataOut [6]:
{'source': 'https://imsdb.com/scripts/BlacKkKlansman.html'}