Robuta

https://catalog.ldc.upenn.edu/LDC2004T19 Fisher English Training Speech Part 1 Transcripts - Linguistic Data Consortium Introduction Fisher English Training Speech Part 1 Transcripts was developed by the Linguistic Data Consortium (LDC) and contains time-aligned transcript... english traininglinguistic datafisherspeechpart https://catalog.ldc.upenn.edu/byyear Linguistic Data Consortium - Linguistic Data Consortium linguistic dataconsortium https://catalog.ldc.upenn.edu/docs/LDC2018T06/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2024S02 Second Language University Speech Intelligibility Corpus - Linguistic Data Consortium Introduction Second Language University Speech Intelligibility Corpus was developed by Northern Arizona University, The Pennsylvania State University, and... second languagespeech intelligibilitylinguistic datauniversitycorpus https://catalog.ldc.upenn.edu/LDC2019T09 DEFT Spanish Committed Belief Annotation - Linguistic Data Consortium Introduction DEFT Spanish Committed Belief Annotation was developed by the Linguistic Data Consortium (LDC) and consists of approximately 67,000 tokens of... linguistic datadeftspanishcommittedbelief https://catalog.ldc.upenn.edu/docs/LDC2020T01/?C=M&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2019S03/?C=M&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2006S26/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2021T02 LORELEI Akan Representative Language Pack - Linguistic Data Consortium Introduction LORELEI Akan Representative Language Pack consists of Akan monolingual text, Akan-English parallel text, annotations, supplemental resources... language packlinguistic dataloreleiakanrepresentative https://catalog.ldc.upenn.edu/LDC2005T35 American National Corpus (ANC) Second Release - Linguistic Data Consortium Introduction American National Corpus (ANC) Second Release was developed by various contributors and contains approximately 22 million words of American... american nationallinguistic datacorpusancsecond https://catalog.ldc.upenn.edu/LDC2016T18 ARL Arabic Dependency Treebank - Linguistic Data Consortium Introduction ARL Arabic Dependency Treebank was developed by the US Army Research Laboratory (ARL) and was derived from four LDC resources: Arabic Treebank... linguistic dataarlarabicdependencyconsortium https://catalog.ldc.upenn.edu/docs/LDC2024S13/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2025T15 KAIROS Phase 2 Quizlet - Linguistic Data Consortium Introduction KAIROS Phase 2 Quizlet was developed by the Linguistic Data Consortium (LDC). It contains English and Spanish text, video and image data and... linguistic datakairosphasequizletconsortium https://catalog.ldc.upenn.edu/LDC95T13 Mandarin Chinese News Text - Linguistic Data Consortium The Linguistic Data Consortium (LDC) announces the availability of a Mandarin Chinese text corpus. This corpus includes about 250 million GB-encoded text... mandarin chinesenews textlinguistic dataconsortium https://catalog.ldc.upenn.edu/LDC97S45 CALLHOME Egyptian Arabic Speech - Linguistic Data Consortium Introduction The CALLHOME Egyptian Arabic corpus of telephone speech consists of 120 unscripted telephone conversations between native speakers of Egyptian... egyptian arabiclinguistic datacallhomespeechconsortium https://languagelog.ldc.upenn.edu/myl/LDC_ArabicData.html Linguistic Data Consortium - Linguistic Data Consortium linguistic dataconsortium https://catalog.ldc.upenn.edu/docs/LDC2020S08/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://ldc-upenn.blogspot.com/2022/09/ Linguistic Data Consortium: September 2022 linguistic data consortiumseptember https://catalog.ldc.upenn.edu/docs/LDC2004T08/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://scholarspace.manoa.hawaii.edu/items/c7927394-80b2-46a9-9c57-1ae6961e3fad Supporting linguistic data collection from afar: A mobile metadata system The global COVID-19 pandemic has put into high relief the need for better remote communication and collaboration tools, but also serves as an opportunity to... linguistic datasupportingcollectionafarmobile https://catalog.ldc.upenn.edu/LDC2021T17 BOLT Egyptian Arabic Treebank - SMS/Chat - Linguistic Data Consortium Introduction BOLT Egyptian Arabic Treebank - SMS/Chat was developed by the Linguistic Data Consortium (LDC) and consists of Egyptian Arabic SMS/Chat data... egyptian arabicsms chatlinguistic databoltconsortium https://catalog.ldc.upenn.edu/docs/LDC2004T23/?C=S&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2008T21/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2001S16/?C=S&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2019T19/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2004T23 Prague Arabic Dependency Treebank 1.0 - Linguistic Data Consortium Introduction Prague Arabic Dependency Treebank (PADT) 1.0 was developed by the Center for Computational Linguistics, the Institute of Formal and Applied... linguistic datapraguearabicdependencyconsortium https://scholars.lib.ntu.edu.tw/entities/publication/c86a6522-799a-4356-b7d5-0adf0f0edce7 Linguistic Data, Corpus, and Corpus-based for Linguistic Research linguistic datacorpusbasedresearch https://catalog.ldc.upenn.edu/docs/LDC2018S14/?C=M&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2010T19/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://ldc-upenn.blogspot.com/2024/02/ Linguistic Data Consortium: February 2024 linguistic data consortiumfebruary https://cran.wustl.edu/web/packages/rcldf/vignettes/using-rcldf.html Using rcldf to work with Cross-Linguistic Data Format datasets to worklinguistic datausingcrossformat https://catalog.ldc.upenn.edu/LDC2007S01 Levantine Arabic Conversational Telephone Speech - Linguistic Data Consortium Introduction This database contains 982 Levantine Arabic speakers taking part in spontaneous telephone conversations in Colloquial Levantine Arabic. A total... levantine arabiclinguistic dataconversationaltelephonespeech https://catalog.ldc.upenn.edu/docs/LDC93S4A/read_doc/?C=M&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2005T13 CCGbank - Linguistic Data Consortium Introduction CCGbank was developed by the University of Edinburgh and contains approximately 49,000 sentences of English text formatted in Combinatory... linguistic dataconsortium https://ldc-upenn.blogspot.com/2013/04/ Linguistic Data Consortium: April 2013 linguistic data consortiumapril https://catalog.ldc.upenn.edu/docs/LDC2017T14/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2021S08 RATS Speaker Identification - Linguistic Data Consortium Introduction RATS Speaker Identification was developed by the Linguistic Data Consortium (LDC) and is comprised of approximately 1,900 hours of Levantine... speaker identificationlinguistic dataratsconsortium https://catalog.ldc.upenn.edu/LDC2003T07 Arabic Treebank: Part 1 - 10K-word English Translation - Linguistic Data Consortium Introduction Arabic Treebank: Part 1 - 10K-word English Translation was produced by the Linguistic Data Consortium (LDC) and contains approximately 10,000... english translationlinguistic dataarabicpart https://catalog.ldc.upenn.edu/docs/LDC2018S05/?C=S&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2006T20/?C=S&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2010S07 Asian Spoken Language Sampler - Linguistic Data Consortium Introduction The Linguistic Data Consortium (LDC) at the University of Pennsylvania distributes a wide and growing assortment of resources for researchers,... spoken languagelinguistic dataasiansamplerconsortium https://catalog.ldc.upenn.edu/docs/LDC2021T15/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2001T05 Speech in Noisy Environments (SPINE2) Part 1 Transcripts - Linguistic Data Consortium Introduction This corpus was used as part of the training set for the Second Speech in Noisy Environments Evaluation (SPINE2). SPINE2 provides a continuing... linguistic dataspeechnoisyenvironments https://catalog.ldc.upenn.edu/LDC2013T06 1993-2007 United Nations Parallel Text - Linguistic Data Consortium Introduction 1993-2007 United Nations Parallel Text was developed by Google Research. It consists of United Nations (UN) parliamentary documents from 1993... united nationsparallel textlinguistic dataconsortium https://catalog.ldc.upenn.edu/docs/LDC2016T20/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2005T29 HARD 2004 Topics and Annotations - Linguistic Data Consortium Introduction The HARD 2004 Text Corpus was developed by the Linguistic Data Consortium (LDC) and contains approximately 225 million tokens of English... linguistic datahardtopicsannotationsconsortium https://catalog.ldc.upenn.edu/LDC2007T40 Arabic Gigaword Third Edition - Linguistic Data Consortium Introduction Arabic Gigaword Third Edition is a comprehensive archive of newswire text data acquired from Arabic news sources by the LDC at the University of... third editionlinguistic dataarabicconsortium https://abacus.library.ubc.ca/dataset.xhtml;jsessionid=c43a1dc6f9a3475daec06b9b20fc?persistentId=hdl%3A11272.1%2FAB2%2FXQKHRG&version=&q=&fileTypeGroupFacet=&fileAccess=Public&fileSortField=date Chinese CogBank - Linguistic Data Consortium Jun 9, 2021 - AbstractIntroductionChinese CogBank is a database of cognitive properties of Chinese words intended for use in metaphor understanding and generation. It... linguistic datachineseconsortium https://publikationen.uni-tuebingen.de/xmlui/handle/10900/176596?show=full Spatial models of linguistic data in Africa and beyond linguistic dataspatialmodelsafricabeyond https://ldc-upenn.blogspot.com/2023/08/ldc-august-2023-newsletter.html Linguistic Data Consortium: LDC August 2023 Newsletter LDC at Interspeech 2023 LDC releases speech activity detector Fall 2023 LDC Data Scholarship Program New publications: 2019 OpenSAT Public S... linguistic data consortiumldcaugustnewsletter https://catalog.ldc.upenn.edu/LDC2015S12 Articulation Index LSCP - Linguistic Data Consortium Introduction Articulation Index LSCP was developed by researchers at Laboratoire de Sciences Cognitives et Psycholinguistique (LSCP), Ecole Normale... linguistic dataarticulationindexlscpconsortium https://ldc-upenn.blogspot.com/2019/07/ Linguistic Data Consortium: July 2019 linguistic data consortiumjuly https://catalog.ldc.upenn.edu/docs/LDC2004T04/?C=N&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://ldc-upenn.blogspot.com/2012/02/ Linguistic Data Consortium: February 2012 linguistic data consortiumfebruary https://catalog.ldc.upenn.edu/LDC2008T02 GALE Phase 1 Arabic Blog Parallel Text - Linguistic Data Consortium Introduction This file contains the documentation for GALE Phase 1 Arabic Blog Parallel Text, Linguistic Data Consortium (LDC) catalog number LDC2008T02,... arabic blogparallel textlinguistic datagalephase https://catalog.ldc.upenn.edu/LDC2002T39 1997 HUB5 Arabic Transcripts - Linguistic Data Consortium Introduction The 1997 HUB5 Arabic Transcripts corpus was produced by the Linguistic Data Consortium (LDC), catalog number LDC2002T39 and ISBN... linguistic dataarabictranscriptsconsortium https://catalog.ldc.upenn.edu/docs/LDC2016T06/?C=S&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2004S07 Switchboard Cellular Part 2 Audio - Linguistic Data Consortium Introduction Switchboard Cellular Part 2 Audio was developed by the Linguistic Data Consortium (LDC) and consists of approximately 200 hours of English... linguistic dataswitchboardcellularpartaudio https://catalog.ldc.upenn.edu/docs/LDC2018S09/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2008S05 2005 NIST Language Recognition Evaluation - Linguistic Data Consortium Introduction 2005 NIST Language Recognition Evaluation was developed by the Linguistic Data Consortium (LDC) and the National Institute of Standards and... language recognitionlinguistic datanistevaluationconsortium https://catalog.ldc.upenn.edu/docs/LDC2024T11/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2009T23 FactBank 1.0 - Linguistic Data Consortium Introduction FactBank 1.0, Linguistic Data Consortium (LDC) catalog number LDC2009T23 and isbn 1-58563-522-7, consists of 208 documents (over 77,000 tokens)... linguistic dataconsortium https://catalog.ldc.upenn.edu/LDC95S22 KING Speaker Verification - Linguistic Data Consortium Introduction KING Speaker Verification was developed by ITT in 1987 under a US government research contract; this release is based on a 1992 reprocessing... linguistic datakingspeakerverificationconsortium https://catalog.ldc.upenn.edu/LDC2025T04 DEFT Spanish Light and Rich ERE Annotation - Linguistic Data Consortium Introduction DEFT Spanish Light and Rich ERE Annotation was developed by the Linguistic Data Consortium (LDC) and consists of 158 Spanish discussion forum... linguistic datadeftspanishlightrich https://ldc-upenn.blogspot.com/2022/11/ Linguistic Data Consortium: November 2022 linguistic data consortiumnovember https://catalog.ldc.upenn.edu/docs/LDC2011T02/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2000T49 Speech in Noisy Environments (SPINE) Training Transcripts - Linguistic Data Consortium Introduction Speech in Noisy Environments (SPINE) Training Transcripts was developed for the Department of Defense (DoD) Digital Voice Processing... linguistic dataspeechnoisyenvironmentsspine https://catalog.ldc.upenn.edu/docs/LDC2018T22/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2012T11 American English Nickname Collection - Linguistic Data Consortium Introduction American English Nickname Collection was developed by Intelius, Inc. and is a compilation of American English nicknames to given name mappings... american englishlinguistic datanicknamecollectionconsortium https://catalog.ldc.upenn.edu/LDC96S38 DCIEM/HCRC - Linguistic Data Consortium Introduction DCIEM/HCRC was developed by the Defence and Civil Institute of Environmental Medicine in Canada and the Human Communication Research Centre at... linguistic datadciemconsortium https://catalog.ldc.upenn.edu/LDC2025S04 BOLT CTS CALLFRIEND CALLHOME Mainland Mandarin Chinese Audio - Linguistic Data Consortium Introduction BOLT CTS CALLFRIEND CALLHOME Mainland Mandarin Chinese Audio was developed by the Linguistic Data Consortium (LDC) and consists of... mandarin chineselinguistic databoltctscallhome https://catalog.ldc.upenn.edu/LDC2008S09 CHAracterizing INdividual Speakers (CHAINS) - Linguistic Data Consortium Introduction CHAINS was created by researchers at University College Dublin and contains recordings of thirty-six English speakers reading fables and... linguistic datacharacterizingindividualspeakerschains https://catalog.ldc.upenn.edu/LDC2004T16 2001 Communicator Dialogue Act Tagged - Linguistic Data Consortium Introduction 2001 Communicator Dialogue Act Tagged was produced by the Linguistic Data Consortium (LDC) and contains approximately 1.15 million words of... linguistic datacommunicatordialogueacttagged https://catalog.ldc.upenn.edu/LDC2023T10 AIDA Scenario 1 and 2 Reference Knowledge Base - Linguistic Data Consortium Introduction AIDA Scenario 1 and 2 Reference Knowledge Base was developed by the Linguistic Data Consortium (LDC) and contains the English knowledge base... knowledge baselinguistic dataaidascenario https://catalog.ldc.upenn.edu/LDC2007T01 Levantine Arabic Conversational Telephone Speech, Transcripts - Linguistic Data Consortium Introduction This database contains 982 Levantine Arabic speakers taking part in spontaneous telephone conversations in Colloquial Levantine Arabic. A total... levantine arabiclinguistic dataconversationaltelephonespeech https://catalog.ldc.upenn.edu/LDC2016T14 GALE Phase 4 Arabic Weblog Parallel Sentences - Linguistic Data Consortium Introduction GALE Phase 4 Arabic Weblog Parallel Sentences was developed by the Linguistic Data Consortium (LDC). Along with other corpora, the parallel... linguistic datagalephasearabicweblog https://catalog.ldc.upenn.edu/LDC2015S09 LDC Spoken Language Sampler - Third Release - Linguistic Data Consortium Introduction LDC (Linguistic Data Consortium) Spoken Language Sampler - Third Release contains samples from 20 different corpora published by LDC between... spoken languagelinguistic dataldcsamplerthird https://catalog.ldc.upenn.edu/LDC2026S05 MATERIAL Tagalog-English Language Pack - Linguistic Data Consortium Introduction MATERIAL Tagalog-English Language Pack was developed by Appen for the IARPA (Intelligence Advanced Research Projects Activity) MATERIAL... english languagelinguistic datamaterialtagalogpack https://catalog.ldc.upenn.edu/docs/LDC2018T16/task_descriptions/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2001T55 Arabic Newswire Part 1 - Linguistic Data Consortium Introduction This publication contains the Arabic Newswire A Corpus, Linguistic Data Consortium (LDC) catalog number LDC2001T55 and ISBN 1-58563-190-6. The... linguistic dataarabicnewswirepartconsortium https://ldc-upenn.blogspot.com/2024/07/ Linguistic Data Consortium: July 2024 linguistic data consortiumjuly https://ldc-upenn.blogspot.com/2013/03/ Linguistic Data Consortium: March 2013 linguistic data consortiummarch https://catalog.ldc.upenn.edu/LDC2023L01 Moroccan Arabic - English Lexical Database - Linguistic Data Consortium Introduction Moroccan Arabic - English Lexical Database was developed by the Linguistic Data Consortium (LDC). It is comprised of a set of five interrelated... moroccan arabiclinguistic dataenglishlexicaldatabase https://catalog.ldc.upenn.edu/docs/LDC2009T23/?C=M&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2023T05/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2004T04/?C=N&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2023T04 DEFT English Light and Rich ERE Annotation - Linguistic Data Consortium Introduction DEFT English Light and Rich ERE Annotation was developed by the Linguistic Data Consortium (LDC) and consists of 1190 English discussion forum,... linguistic datadeftenglishlightrich https://catalog.ldc.upenn.edu/docs/LDC2003T10/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://cldf.clld.org/ CLDF - Cross-Linguistic Data Formats linguistic datacldfcrossformats https://catalog.ldc.upenn.edu/LDC2002T31 The AQUAINT Corpus of English News Text - Linguistic Data Consortium Introduction The AQUAINT Corpus, Linguistic Data Consortium (LDC) catalog number LDC2002T31 and ISBN 1-58563-240-6 consists of newswire text data in English,... english newslinguistic dataaquaintcorpustext https://catalog.ldc.upenn.edu/docs/LDC2008T17/?C=N&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/topten Linguistic Data Consortium - Linguistic Data Consortium linguistic dataconsortium https://catalog.ldc.upenn.edu/docs/LDC2018S14/?C=N&O=A Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2022S12/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/docs/LDC2024S12/?C=S&O=D Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2008T19 The New York Times Annotated Corpus - Linguistic Data Consortium Introduction The New York Times Annotated Corpus contains over 1.8 million articles written and published by the New York Times between January 1, 1987 and... the new york timeslinguistic dataannotatedcorpusconsortium https://ldc-upenn.blogspot.com/2024/03/ Linguistic Data Consortium: March 2024 linguistic data consortiummarch https://catalog.ldc.upenn.edu/docs/LDC2026L02/ Linguistic Data Consortium Catalog linguistic data consortiumcatalog https://catalog.ldc.upenn.edu/LDC2020T14 Speech Sentiment Annotations - Linguistic Data Consortium Introduction Speech Sentiment Annotations was developed by Google Inc. It consists of sentiment labels (positive, negative, neutral) for approximately... linguistic dataspeechsentimentannotationsconsortium https://catalog.ldc.upenn.edu/LDC2017T13 2015-2016 CoNLL Shared Task - Linguistic Data Consortium Introduction 2015-2016 CoNLL Shared Task, LDC Catalog Number LDC2017T13 and ISBN 1-58563-812-9, contains the Chinese and English training, development and... shared tasklinguistic dataconllconsortium