https://catalog.ldc.upenn.edu/LDC2004T19
Fisher English Training Speech Part 1 Transcripts - Linguistic Data Consortium
Introduction Fisher English Training Speech Part 1 Transcripts was developed by the Linguistic Data Consortium (LDC) and contains time-aligned transcript...
english traininglinguistic datafisherspeechpart
https://catalog.ldc.upenn.edu/byyear
Linguistic Data Consortium - Linguistic Data Consortium
linguistic dataconsortium
https://catalog.ldc.upenn.edu/docs/LDC2018T06/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2024S02
Second Language University Speech Intelligibility Corpus - Linguistic Data Consortium
Introduction Second Language University Speech Intelligibility Corpus was developed by Northern Arizona University, The Pennsylvania State University, and...
second languagespeech intelligibilitylinguistic datauniversitycorpus
https://catalog.ldc.upenn.edu/LDC2019T09
DEFT Spanish Committed Belief Annotation - Linguistic Data Consortium
Introduction DEFT Spanish Committed Belief Annotation was developed by the Linguistic Data Consortium (LDC) and consists of approximately 67,000 tokens of...
linguistic datadeftspanishcommittedbelief
https://catalog.ldc.upenn.edu/docs/LDC2020T01/?C=M&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2019S03/?C=M&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2006S26/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2021T02
LORELEI Akan Representative Language Pack - Linguistic Data Consortium
Introduction LORELEI Akan Representative Language Pack consists of Akan monolingual text, Akan-English parallel text, annotations, supplemental resources...
language packlinguistic dataloreleiakanrepresentative
https://catalog.ldc.upenn.edu/LDC2005T35
American National Corpus (ANC) Second Release - Linguistic Data Consortium
Introduction American National Corpus (ANC) Second Release was developed by various contributors and contains approximately 22 million words of American...
american nationallinguistic datacorpusancsecond
https://catalog.ldc.upenn.edu/LDC2016T18
ARL Arabic Dependency Treebank - Linguistic Data Consortium
Introduction ARL Arabic Dependency Treebank was developed by the US Army Research Laboratory (ARL) and was derived from four LDC resources: Arabic Treebank...
linguistic dataarlarabicdependencyconsortium
https://catalog.ldc.upenn.edu/docs/LDC2024S13/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2025T15
KAIROS Phase 2 Quizlet - Linguistic Data Consortium
Introduction KAIROS Phase 2 Quizlet was developed by the Linguistic Data Consortium (LDC). It contains English and Spanish text, video and image data and...
linguistic datakairosphasequizletconsortium
https://catalog.ldc.upenn.edu/LDC95T13
Mandarin Chinese News Text - Linguistic Data Consortium
The Linguistic Data Consortium (LDC) announces the availability of a Mandarin Chinese text corpus. This corpus includes about 250 million GB-encoded text...
mandarin chinesenews textlinguistic dataconsortium
https://catalog.ldc.upenn.edu/LDC97S45
CALLHOME Egyptian Arabic Speech - Linguistic Data Consortium
Introduction The CALLHOME Egyptian Arabic corpus of telephone speech consists of 120 unscripted telephone conversations between native speakers of Egyptian...
egyptian arabiclinguistic datacallhomespeechconsortium
https://languagelog.ldc.upenn.edu/myl/LDC_ArabicData.html
Linguistic Data Consortium - Linguistic Data Consortium
linguistic dataconsortium
https://catalog.ldc.upenn.edu/docs/LDC2020S08/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://ldc-upenn.blogspot.com/2022/09/
Linguistic Data Consortium: September 2022
linguistic data consortiumseptember
https://catalog.ldc.upenn.edu/docs/LDC2004T08/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://scholarspace.manoa.hawaii.edu/items/c7927394-80b2-46a9-9c57-1ae6961e3fad
Supporting linguistic data collection from afar: A mobile metadata system
The global COVID-19 pandemic has put into high relief the need for better remote communication and collaboration tools, but also serves as an opportunity to...
linguistic datasupportingcollectionafarmobile
https://catalog.ldc.upenn.edu/LDC2021T17
BOLT Egyptian Arabic Treebank - SMS/Chat - Linguistic Data Consortium
Introduction BOLT Egyptian Arabic Treebank - SMS/Chat was developed by the Linguistic Data Consortium (LDC) and consists of Egyptian Arabic SMS/Chat data...
egyptian arabicsms chatlinguistic databoltconsortium
https://catalog.ldc.upenn.edu/docs/LDC2004T23/?C=S&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2008T21/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2001S16/?C=S&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2019T19/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2004T23
Prague Arabic Dependency Treebank 1.0 - Linguistic Data Consortium
Introduction Prague Arabic Dependency Treebank (PADT) 1.0 was developed by the Center for Computational Linguistics, the Institute of Formal and Applied...
linguistic datapraguearabicdependencyconsortium
https://scholars.lib.ntu.edu.tw/entities/publication/c86a6522-799a-4356-b7d5-0adf0f0edce7
Linguistic Data, Corpus, and Corpus-based for Linguistic Research
linguistic datacorpusbasedresearch
https://catalog.ldc.upenn.edu/docs/LDC2018S14/?C=M&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2010T19/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://ldc-upenn.blogspot.com/2024/02/
Linguistic Data Consortium: February 2024
linguistic data consortiumfebruary
https://cran.wustl.edu/web/packages/rcldf/vignettes/using-rcldf.html
Using rcldf to work with Cross-Linguistic Data Format datasets
to worklinguistic datausingcrossformat
https://catalog.ldc.upenn.edu/LDC2007S01
Levantine Arabic Conversational Telephone Speech - Linguistic Data Consortium
Introduction This database contains 982 Levantine Arabic speakers taking part in spontaneous telephone conversations in Colloquial Levantine Arabic. A total...
levantine arabiclinguistic dataconversationaltelephonespeech
https://catalog.ldc.upenn.edu/docs/LDC93S4A/read_doc/?C=M&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2005T13
CCGbank - Linguistic Data Consortium
Introduction CCGbank was developed by the University of Edinburgh and contains approximately 49,000 sentences of English text formatted in Combinatory...
linguistic dataconsortium
https://ldc-upenn.blogspot.com/2013/04/
Linguistic Data Consortium: April 2013
linguistic data consortiumapril
https://catalog.ldc.upenn.edu/docs/LDC2017T14/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2021S08
RATS Speaker Identification - Linguistic Data Consortium
Introduction RATS Speaker Identification was developed by the Linguistic Data Consortium (LDC) and is comprised of approximately 1,900 hours of Levantine...
speaker identificationlinguistic dataratsconsortium
https://catalog.ldc.upenn.edu/LDC2003T07
Arabic Treebank: Part 1 - 10K-word English Translation - Linguistic Data Consortium
Introduction Arabic Treebank: Part 1 - 10K-word English Translation was produced by the Linguistic Data Consortium (LDC) and contains approximately 10,000...
english translationlinguistic dataarabicpart
https://catalog.ldc.upenn.edu/docs/LDC2018S05/?C=S&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2006T20/?C=S&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2010S07
Asian Spoken Language Sampler - Linguistic Data Consortium
Introduction The Linguistic Data Consortium (LDC) at the University of Pennsylvania distributes a wide and growing assortment of resources for researchers,...
spoken languagelinguistic dataasiansamplerconsortium
https://catalog.ldc.upenn.edu/docs/LDC2021T15/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2001T05
Speech in Noisy Environments (SPINE2) Part 1 Transcripts - Linguistic Data Consortium
Introduction This corpus was used as part of the training set for the Second Speech in Noisy Environments Evaluation (SPINE2). SPINE2 provides a continuing...
linguistic dataspeechnoisyenvironments
https://catalog.ldc.upenn.edu/LDC2013T06
1993-2007 United Nations Parallel Text - Linguistic Data Consortium
Introduction 1993-2007 United Nations Parallel Text was developed by Google Research. It consists of United Nations (UN) parliamentary documents from 1993...
united nationsparallel textlinguistic dataconsortium
https://catalog.ldc.upenn.edu/docs/LDC2016T20/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2005T29
HARD 2004 Topics and Annotations - Linguistic Data Consortium
Introduction The HARD 2004 Text Corpus was developed by the Linguistic Data Consortium (LDC) and contains approximately 225 million tokens of English...
linguistic datahardtopicsannotationsconsortium
https://catalog.ldc.upenn.edu/LDC2007T40
Arabic Gigaword Third Edition - Linguistic Data Consortium
Introduction Arabic Gigaword Third Edition is a comprehensive archive of newswire text data acquired from Arabic news sources by the LDC at the University of...
third editionlinguistic dataarabicconsortium
https://abacus.library.ubc.ca/dataset.xhtml;jsessionid=c43a1dc6f9a3475daec06b9b20fc?persistentId=hdl%3A11272.1%2FAB2%2FXQKHRG&version=&q=&fileTypeGroupFacet=&fileAccess=Public&fileSortField=date
Chinese CogBank - Linguistic Data Consortium
Jun 9, 2021 - AbstractIntroductionChinese CogBank is a database of cognitive properties of Chinese words intended for use in metaphor understanding and generation. It...
linguistic datachineseconsortium
https://publikationen.uni-tuebingen.de/xmlui/handle/10900/176596?show=full
Spatial models of linguistic data in Africa and beyond
linguistic dataspatialmodelsafricabeyond
https://ldc-upenn.blogspot.com/2023/08/ldc-august-2023-newsletter.html
Linguistic Data Consortium: LDC August 2023 Newsletter
LDC at Interspeech 2023 LDC releases speech activity detector Fall 2023 LDC Data Scholarship Program New publications: 2019 OpenSAT Public S...
linguistic data consortiumldcaugustnewsletter
https://catalog.ldc.upenn.edu/LDC2015S12
Articulation Index LSCP - Linguistic Data Consortium
Introduction Articulation Index LSCP was developed by researchers at Laboratoire de Sciences Cognitives et Psycholinguistique (LSCP), Ecole Normale...
linguistic dataarticulationindexlscpconsortium
https://ldc-upenn.blogspot.com/2019/07/
Linguistic Data Consortium: July 2019
linguistic data consortiumjuly
https://catalog.ldc.upenn.edu/docs/LDC2004T04/?C=N&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://ldc-upenn.blogspot.com/2012/02/
Linguistic Data Consortium: February 2012
linguistic data consortiumfebruary
https://catalog.ldc.upenn.edu/LDC2008T02
GALE Phase 1 Arabic Blog Parallel Text - Linguistic Data Consortium
Introduction This file contains the documentation for GALE Phase 1 Arabic Blog Parallel Text, Linguistic Data Consortium (LDC) catalog number LDC2008T02,...
arabic blogparallel textlinguistic datagalephase
https://catalog.ldc.upenn.edu/LDC2002T39
1997 HUB5 Arabic Transcripts - Linguistic Data Consortium
Introduction The 1997 HUB5 Arabic Transcripts corpus was produced by the Linguistic Data Consortium (LDC), catalog number LDC2002T39 and ISBN...
linguistic dataarabictranscriptsconsortium
https://catalog.ldc.upenn.edu/docs/LDC2016T06/?C=S&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2004S07
Switchboard Cellular Part 2 Audio - Linguistic Data Consortium
Introduction Switchboard Cellular Part 2 Audio was developed by the Linguistic Data Consortium (LDC) and consists of approximately 200 hours of English...
linguistic dataswitchboardcellularpartaudio
https://catalog.ldc.upenn.edu/docs/LDC2018S09/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2008S05
2005 NIST Language Recognition Evaluation - Linguistic Data Consortium
Introduction 2005 NIST Language Recognition Evaluation was developed by the Linguistic Data Consortium (LDC) and the National Institute of Standards and...
language recognitionlinguistic datanistevaluationconsortium
https://catalog.ldc.upenn.edu/docs/LDC2024T11/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2009T23
FactBank 1.0 - Linguistic Data Consortium
Introduction FactBank 1.0, Linguistic Data Consortium (LDC) catalog number LDC2009T23 and isbn 1-58563-522-7, consists of 208 documents (over 77,000 tokens)...
linguistic dataconsortium
https://catalog.ldc.upenn.edu/LDC95S22
KING Speaker Verification - Linguistic Data Consortium
Introduction KING Speaker Verification was developed by ITT in 1987 under a US government research contract; this release is based on a 1992 reprocessing...
linguistic datakingspeakerverificationconsortium
https://catalog.ldc.upenn.edu/LDC2025T04
DEFT Spanish Light and Rich ERE Annotation - Linguistic Data Consortium
Introduction DEFT Spanish Light and Rich ERE Annotation was developed by the Linguistic Data Consortium (LDC) and consists of 158 Spanish discussion forum...
linguistic datadeftspanishlightrich
https://ldc-upenn.blogspot.com/2022/11/
Linguistic Data Consortium: November 2022
linguistic data consortiumnovember
https://catalog.ldc.upenn.edu/docs/LDC2011T02/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2000T49
Speech in Noisy Environments (SPINE) Training Transcripts - Linguistic Data Consortium
Introduction Speech in Noisy Environments (SPINE) Training Transcripts was developed for the Department of Defense (DoD) Digital Voice Processing...
linguistic dataspeechnoisyenvironmentsspine
https://catalog.ldc.upenn.edu/docs/LDC2018T22/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2012T11
American English Nickname Collection - Linguistic Data Consortium
Introduction American English Nickname Collection was developed by Intelius, Inc. and is a compilation of American English nicknames to given name mappings...
american englishlinguistic datanicknamecollectionconsortium
https://catalog.ldc.upenn.edu/LDC96S38
DCIEM/HCRC - Linguistic Data Consortium
Introduction DCIEM/HCRC was developed by the Defence and Civil Institute of Environmental Medicine in Canada and the Human Communication Research Centre at...
linguistic datadciemconsortium
https://catalog.ldc.upenn.edu/LDC2025S04
BOLT CTS CALLFRIEND CALLHOME Mainland Mandarin Chinese Audio - Linguistic Data Consortium
Introduction BOLT CTS CALLFRIEND CALLHOME Mainland Mandarin Chinese Audio was developed by the Linguistic Data Consortium (LDC) and consists of...
mandarin chineselinguistic databoltctscallhome
https://catalog.ldc.upenn.edu/LDC2008S09
CHAracterizing INdividual Speakers (CHAINS) - Linguistic Data Consortium
Introduction CHAINS was created by researchers at University College Dublin and contains recordings of thirty-six English speakers reading fables and...
linguistic datacharacterizingindividualspeakerschains
https://catalog.ldc.upenn.edu/LDC2004T16
2001 Communicator Dialogue Act Tagged - Linguistic Data Consortium
Introduction 2001 Communicator Dialogue Act Tagged was produced by the Linguistic Data Consortium (LDC) and contains approximately 1.15 million words of...
linguistic datacommunicatordialogueacttagged
https://catalog.ldc.upenn.edu/LDC2023T10
AIDA Scenario 1 and 2 Reference Knowledge Base - Linguistic Data Consortium
Introduction AIDA Scenario 1 and 2 Reference Knowledge Base was developed by the Linguistic Data Consortium (LDC) and contains the English knowledge base...
knowledge baselinguistic dataaidascenario
https://catalog.ldc.upenn.edu/LDC2007T01
Levantine Arabic Conversational Telephone Speech, Transcripts - Linguistic Data Consortium
Introduction This database contains 982 Levantine Arabic speakers taking part in spontaneous telephone conversations in Colloquial Levantine Arabic. A total...
levantine arabiclinguistic dataconversationaltelephonespeech
https://catalog.ldc.upenn.edu/LDC2016T14
GALE Phase 4 Arabic Weblog Parallel Sentences - Linguistic Data Consortium
Introduction GALE Phase 4 Arabic Weblog Parallel Sentences was developed by the Linguistic Data Consortium (LDC). Along with other corpora, the parallel...
linguistic datagalephasearabicweblog
https://catalog.ldc.upenn.edu/LDC2015S09
LDC Spoken Language Sampler - Third Release - Linguistic Data Consortium
Introduction LDC (Linguistic Data Consortium) Spoken Language Sampler - Third Release contains samples from 20 different corpora published by LDC between...
spoken languagelinguistic dataldcsamplerthird
https://catalog.ldc.upenn.edu/LDC2026S05
MATERIAL Tagalog-English Language Pack - Linguistic Data Consortium
Introduction MATERIAL Tagalog-English Language Pack was developed by Appen for the IARPA (Intelligence Advanced Research Projects Activity) MATERIAL...
english languagelinguistic datamaterialtagalogpack
https://catalog.ldc.upenn.edu/docs/LDC2018T16/task_descriptions/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2001T55
Arabic Newswire Part 1 - Linguistic Data Consortium
Introduction This publication contains the Arabic Newswire A Corpus, Linguistic Data Consortium (LDC) catalog number LDC2001T55 and ISBN 1-58563-190-6. The...
linguistic dataarabicnewswirepartconsortium
https://ldc-upenn.blogspot.com/2024/07/
Linguistic Data Consortium: July 2024
linguistic data consortiumjuly
https://ldc-upenn.blogspot.com/2013/03/
Linguistic Data Consortium: March 2013
linguistic data consortiummarch
https://catalog.ldc.upenn.edu/LDC2023L01
Moroccan Arabic - English Lexical Database - Linguistic Data Consortium
Introduction Moroccan Arabic - English Lexical Database was developed by the Linguistic Data Consortium (LDC). It is comprised of a set of five interrelated...
moroccan arabiclinguistic dataenglishlexicaldatabase
https://catalog.ldc.upenn.edu/docs/LDC2009T23/?C=M&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2023T05/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2004T04/?C=N&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2023T04
DEFT English Light and Rich ERE Annotation - Linguistic Data Consortium
Introduction DEFT English Light and Rich ERE Annotation was developed by the Linguistic Data Consortium (LDC) and consists of 1190 English discussion forum,...
linguistic datadeftenglishlightrich
https://catalog.ldc.upenn.edu/docs/LDC2003T10/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://cldf.clld.org/
CLDF - Cross-Linguistic Data Formats
linguistic datacldfcrossformats
https://catalog.ldc.upenn.edu/LDC2002T31
The AQUAINT Corpus of English News Text - Linguistic Data Consortium
Introduction The AQUAINT Corpus, Linguistic Data Consortium (LDC) catalog number LDC2002T31 and ISBN 1-58563-240-6 consists of newswire text data in English,...
english newslinguistic dataaquaintcorpustext
https://catalog.ldc.upenn.edu/docs/LDC2008T17/?C=N&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/topten
Linguistic Data Consortium - Linguistic Data Consortium
linguistic dataconsortium
https://catalog.ldc.upenn.edu/docs/LDC2018S14/?C=N&O=A
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2022S12/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/docs/LDC2024S12/?C=S&O=D
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2008T19
The New York Times Annotated Corpus - Linguistic Data Consortium
Introduction The New York Times Annotated Corpus contains over 1.8 million articles written and published by the New York Times between January 1, 1987 and...
the new york timeslinguistic dataannotatedcorpusconsortium
https://ldc-upenn.blogspot.com/2024/03/
Linguistic Data Consortium: March 2024
linguistic data consortiummarch
https://catalog.ldc.upenn.edu/docs/LDC2026L02/
Linguistic Data Consortium Catalog
linguistic data consortiumcatalog
https://catalog.ldc.upenn.edu/LDC2020T14
Speech Sentiment Annotations - Linguistic Data Consortium
Introduction Speech Sentiment Annotations was developed by Google Inc. It consists of sentiment labels (positive, negative, neutral) for approximately...
linguistic dataspeechsentimentannotationsconsortium
https://catalog.ldc.upenn.edu/LDC2017T13
2015-2016 CoNLL Shared Task - Linguistic Data Consortium
Introduction 2015-2016 CoNLL Shared Task, LDC Catalog Number LDC2017T13 and ISBN 1-58563-812-9, contains the Chinese and English training, development and...
shared tasklinguistic dataconllconsortium