说话,看似毫不费力,但其实是人类最复杂的认知活动之一。在过去几十年里,研究人员试图澄清言语表达(又称为“语言产生”)背后的认知架构和动态加工过程。近日,中国科学院心理研究所助理研究员冯臣、研究员屈青青与合作者在Nature旗下的《科学数据》(Scientific Data)发表汉语语言产生数据库。
已有的研究显示,世界上大约有7000种语言,不同语言的词汇、语音、字形系统大相径庭。现有的实证研究与理论框架主要基于印欧语系。与印欧语言不同,汉语有独特之处。
首先,汉语属于汉藏语系,是一种声调语言,同一个音节的不同音调表示不同的词汇与意义,大多数印欧语言则不使用声调来区分词义。其次,印欧语言采用字母拼写系统,而汉语采用非字母书写系统。另外,汉语的语音与字形的对应关系较为复杂,例如,声音“shu”可以对应“书”“梳”“树”或“薯”等多个不同的字形。因此,汉语研究对回答跨语言普遍性和特异性具有独特价值和贡献。
虽然一些研究已经表明,音位是印欧语言语音编码的主要加工单元,而音节是汉语语音编码的主要加工单元,但目前大部分关于语言产生的研究侧重于印欧语言,而对于汉语这一非印欧语言的研究则相对有限。
冯臣和屈青青等人发现,这些研究主要关注于口语产生过程,对于书写等字形产生的关注则明显不足。同时,许多研究依赖于较小的样本量和有限的实验刺激,这可能导致统计效力不足和研究结果的可重复性问题。构建汉语语言产生数据库的需求与日俱增。
此次发表的汉语语言产生数据库记录了667名被试在7种不同语言产生任务中的约20万个试次的反应时间,以及实验材料的多个语言学变量,如词频、字频、音节频率、习得年龄等。
据介绍,该数据库为研究汉语口语和书写产生的语言加工提供了丰富数据资源,为探索汉语产生的普遍性与特异性提供了数据基础。此外,该数据库对于开发汉语语言产生的人工智能模型具有独特价值与贡献,有望推动语言认知科学与人工智能领域的交叉与共同进步。
相关论文信息:https://doi.org/10.1038/s41597-024-03022-8
12月14日,美国《科学》杂志公布了2023年度十大科学突破,胰高糖素样肽-1(GLP-1)受体激动剂的研发以及今年发现的可缓解肥 国际脑科学计划-细胞普查联盟(BICCN)近日发表了迄今为止最全面详细的小鼠完整大脑细胞类型的特性描述和分类,对大脑的结构 人工智能初创企业OpenAI的董事会将有权否决公司CEO推出新版本模型的决定。 当地时间12月18日,OpenAI在官方网站发布了 中新网上海12月19日电 (记者 许婧)上海交通大学分析测试中心实验动物中心新大楼启用仪式19日举行。随着新大楼的落成,一 按照三秦英才引进计划和三秦英才特殊支持计划《实施办法》和2023年省级人才计划评审工作安排,经申报推荐、形式审查 中新网1月1日电 据国家地震台网官方微博消息,中国地震台网自动测定:1月1日15时10分在日本本州西岸近海附近(北纬37.98度,东 。本文链接:汉语语言产生数据库发表http://www.sushuapos.com/show-11-3286-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 科学家发现肠道菌群衍生的新型促血栓物质