登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
IndicFinNLP: Financial NLP for Indian Languages
IndicFinNLP: Financial NLP for Indian Languages
收藏
kaggle
2024-06-03 更新
2024-06-08 收录
金融NLP
印度语言学
数据链接:
https://www.kaggle.com/datasets/sohomghosh/indicfinnlp-financial-nlp-for-indian-languages
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Financial Natural Language Processing for Indian Languages
针对印度语言的金融自然语言处理
应用场景:
创建时间:
2024-06-03
相关数据集
AI4Bharat-IndicNLP Dataset
自然语言处理
印度语言学
AI4Bharat-IndicNLP数据集是一个持续努力创建的,针对印度语言的大规模、通用领域语料库集合。目前,它包含来自两个语系10种印度语言的27亿个单词。该数据集提供预训练的词嵌入,并创建了9种语言的新闻文章分类数据集以评估这些嵌入。
github
2024-05-08 更新
149
0
indic-nlp
自然语言处理
印度语言学
L3Cube-IndicNews是一个面向印度区域语言的新闻标题和文章的多语言文本分类语料库,包含11种印度主要语言,包括印地语、孟加拉语、马拉地语、泰卢固语、泰米尔语、古吉拉特语、卡纳达语、奥里亚语、马拉雅拉姆语、旁遮普语和英语。该数据集分为短标题分类(SHC)、长文档分类(LDC)和长段落分类(LPC)三种类型,每种类型都包含10个或更多类别的新闻文章,以支持不同文档长度的深度分析。
Hugging Face
2025-06-11 更新
17
0
sarvamai/trivia-qa-indic
多语言阅读理解
印度语言学
Indic TriviaQA数据集是TriviaQA阅读理解数据集的多语言版本,从英语翻译成10种印度语言。该版本遵循原始数据集的无上下文格式,包含由琐事爱好者编写的问题-答案对的验证集和测试集的翻译。数据集涵盖的语言包括孟加拉语、古吉拉特语、印地语、卡纳达语、马拉地语、马拉雅拉姆语、奥里亚语、旁遮普语、泰米尔语和泰卢固语。每个示例包含问题文本、答案(包括答案别名和标准化的别名)和语言代码。验证集
Hugging Face
2024-10-23 更新
16
0
ILSUM/ILSUM-1.0
文本摘要
印度语言学
ILSUM-1.0数据集旨在为印度语言的自动文本摘要任务提供可重用的语料库。该数据集涵盖了印地语、古吉拉特语和印度英语,每个语言提供约10,000篇新闻文章。数据集的独特挑战在于代码混合和脚本混合现象,即新闻文章中常借用英语短语。数据字段包括id、文章、标题和摘要。数据分为训练集、验证集和测试集。
Hugging Face
2023-07-26 更新
23
0
LinguaLift/IndicMMLU-Pro
多语言AI
印度语言学
IndicMMLU数据集是一个用于评估多语言AI模型在印度语言上的表现的基准数据集。它包含了多种印度语言(如旁遮普语、印地语、乌尔都语、泰卢固语、古吉拉特语、卡纳达语、泰米尔语、马拉地语、孟加拉语)的验证集和测试集。
Hugging Face
2025-02-01 更新
17
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广