400 128 6709

行业新闻

疫情微博情绪识别挑战赛Baseline(PaddlePaddle)-0.9735

发布时间:2025-07-23点击次数:
本文围绕疫情微博情绪识别挑战赛展开,介绍赛事背景、任务、评审规则等。采用预训练模型+微调方式,通过Multi-dropout和不同特征池化方案优化,从小模型到参数大的模型实验,结合模型融合策略,最终ernie-3.0-base-zh单模线上成绩达0.9735,为情绪识别提供有效方案。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

疫情微博情绪识别挑战赛baseline(paddlepaddle)-0.9735 -

疫情微博情绪识别挑战赛

疫情微博情绪识别挑战赛

举办方:科大讯飞xDatawhale

赛事地址:疫情微博情绪识别挑战赛-点击直达

赛事背景

疫情发生对人们生活生产的方方面面产生了重要影响,并引发了国内舆论的广泛关注,众多网民也参与到了疫情相关话题的讨论中。大众日常的情绪波动在疫情期间会放大,并寻求在自媒体和社交媒体上发布和评论。

为了掌握真实社会舆论情况,科学高效地做好防控宣传和舆情引导工作,针对疫情相关话题开展网民情绪识别是重要任务。本次我们重点关注微博平台上的用户情绪,希望各位选手能搭建自然语言处理模型,对疫情下微博文本的情绪进行识别。

赛事任务

本次赛题需要选手对微博文本进行情绪分类,分为正向情绪和负面情绪。数据样例如下:

疫情微博情绪识别挑战赛Baseline(PaddlePaddle)-0.9735 -

评审规则

  1. 数据说明

赛题数据由训练集和测试集组成,训练集数据集读取代码:

import pandas as pd pd.read_csv('train.csv',sep='\t')
  1. 评估指标

本次竞赛的评价标准采用准确率指标,最高分为1。 计算方法参考地址:https://scikit-learn.org/stable/modules/generated/sklearn.metrics.accuracy_score.html

评估代码参考:

import sklearn.metrics import accuracy_score y_pred = [0,2,1,3] y_true = [0,1,2,3] accuracy_score(y_pred,y_true)
  1. 评测及排行

1、赛事提供下载数据,选手在本地进行算法调试,在比赛页面提交结果。

2、每支团队每天最多提交3次。

3、排行按照得分从高到低排序,排行榜将选择团队的历史最优成绩进行排名。

作品提交要求

文件格式:预测结果文件按照csv格式提交

文件大小:无要求

提交次数限制:每支队伍每天最多3次

预测结果文件详细说明:

  1. 以csv格式提交,编码为UTF-8,第一行为表头;

  2. 标签顺序需要与测试集文本保持一致;

  3. 提交前请确保预测结果的格式与sample_submit.csv中的格式一致。具体格式如:

    简小派 简小派

    简小派是一款AI原生求职工具,通过简历优化、岗位匹配、项目生成、模拟面试与智能投递,全链路提升求职成功率,帮助普通人更快拿到更好的 offer。

    简小派 123 查看详情 简小派
label 1 1 1 1

赛程安排

正式赛:6月24日——7月23日

初赛截止成绩以团队在初赛时间段内最优成绩为准,具体排名可见初赛榜单。

初赛作品提交截止日期为7月23日17:00;正式赛名次将于结束后15天内公布。

长期赛:7月24日——10月24日

正式赛结束后,将转变为长期赛,供开发者学习实践。本阶段提交后,系统会根据成绩持续更新长期赛榜单,但该阶段榜单不再进行奖励。

Baseline思路

情感分析是一个经典的文本分类任务,初始Baseline采用预训练模型+微调下游任务的方式搭建

通过两种策略优化Baseline方法得到一个强基线的Baseline方案

策略一:Mutli-dropout

策略二:比较不同的特征池化方案,选取更合适的特征池化方法

先使用参数少的小模型(erbie-3.0-nano)得到初步的最优组合方案,再更换参数大的(erbie-3.0-base)模型结合最优策略得到较强的单模结果。

Baseline 效果

由于提交次数宝贵,因此仅提交了其中三份结果进行验证

一是小模型上验证效果最好(0.963)的单模结果

二是小模型上多模型融合的结果

三是切换为大模型(ernie-3.0-base-zh)的单模效果

模型 线下验证 线上提交
ernie-3.0-nano-zh + cls 0.962000 -
ernie-3.0-nano-zh + max 0.961833 -
ernie-3.0-nano-zh + mean 0.962167 -
ernie-3.0-nano-zh + dym 0.962333 -
ernie-3.0-nano-zh + dym + mutlidropout 0.963000 0.9655
ernie-3.0-nano-zh + mean + mutlidropout 0.962833 -
ernie-3.0-nano-zh + cls + mutlidropout 0.962667 -
ernie-3.0-nano-zh + max + mutlidropout 0.962667 -
ernie-3.0-nano模型融合(voting) - 0.9663
ernie-3.0-base-zh + dym + mutlidropout 0.97100 0.9735

从结果上看:

  • Mutlidropout策略十分有效,在不同池化策略的基础上添加Mutlidropout验证效果均有明显涨分
  • 嵌入策略上动态加权池化方法效果最优,其次是平均池化策略
  • 基于Voting的模型融合策略也可以提升模型的性能
  • 更换base版本的大模型后,通过两个策略的加持,线上成绩到达0.9735,靠单模成绩上排行第三,

总结:

  1. 使用了两种有效的策略(Mutlidropout和动态池化策略)获得一个强基线的baseline,希望对还未提升到0.972分数以上的小伙伴一些启发,基于这个强基线的baseline是可以冲击到0.973等更高的分数。

  2. Baseline项目使用ernie-3.0的nano模型仅72MB,micro和nano版本不超过100MB,对资源要求友好,在当前超参数配置下(最大截断长度200,训练批次大小64)显存占用不到5GB,训练3轮5.4万条样本仅需11分钟左右,取得线上0.9655(Rank35 时间:2025-07-09)

  3. 当更换参数量更大的Base模型后,相同配置下显存占用19GB左右,训练时间提升到30分钟。更换Base后的强基线单模线下得到0.9735,进入前五梯队(Rank3 时间:2025-07-09)

疫情微博情绪识别挑战赛Baseline(PaddlePaddle)-0.9735 -

后续优化推荐

  • 使用FGM等对抗训练提升模型的鲁棒性
  • 使用EMA增加模型在测试集上的健壮性
  • 融合不同模型,采用不同的模型融合策略

In [ ]

# 将paddlenlp更新至最新版本 !pip install -U paddlenlp # emoji转换成文字 !pip install emojiswitch

In [6]

# 测试 emoji<a style="color:#f60; text-decoration:underline;" title="switch" href="https://www.php.cn/zt/17738.html" target="_blank">switch</a> 效果 import emojiswitch emojiswitch.demojize('心中千万只

以上就是疫情微博情绪识别挑战赛Baseline(PaddlePaddle)-0.9735的详细内容,更多请关注其它相关文章!


# 一键  # 快速网络营销推广服务商  # 宁夏seo公司快速入门  # 北流网站建设及优化  # 盐田怎么找网站优化  # 罗庄抖音营销推广电话  # 自述网站建设流程  # 湖南植物素材网站建设  # 信用中国网站建设意义  # 个人网络营销推广要求  # 宜良网站优化行情  # 博文  # 安装包  # git  # 显存  # 榜单  # 两种  # 最多  # 线上  # 中文网  # 最优  # type  # fig  # red  # switch  # ai 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 阿里大文娱CTO郑勇:生成式AI将引发内容行业巨变,*制作机会挑战并存  导演郭帆:人工智能应用可能会影响《流浪地球 3》的创作开发  WAIC 2025|云深处科技绝影Lite3与X20四足机器人亮相  能走、能飞、能游泳,科学家打造全能 M4 机器人  智能技术提高现代商业运营的7七种方式  小米9号员工李明宣布创业:打造首款安卓桌面机器人  聚焦WAIC|AI技术支撑大模型探索未来  【趋势周报】全球元宇宙产业发展趋势:ChatGPT的出现,将元宇宙实现至少提前了10年  海南省公安机关警用无人机培训班结业并举行警航比武演练  AI成政客博弈工具,美国大选真假难辨,律师们的生意来了  意大利警察拟用AI预测犯罪 该算法被指种族歧视严重  浪潮KaiwuDB:“快人一步” - 打造更懂物联网的数据库  朝鲜出现国产大型察打一体无人机,实力世界第二,太意外了  微软推出 LLaVA-Med AI 模型,可对医学病理案例进行分析  马斯克嘲讽人工智能:机器学习本质就是统计学  国内阅读行业首款对话式AI应用“阅爱聊”封闭内测  外科医生的智能助手,“机器人手术”得到补充商业医保覆盖  全新小艺搭载AI大模型,有效提升学生和职场人士的工作效率  自研4D激光雷达L1 + GPT大语言模型 宇树Unitree Go2四足机器人有啥黑科技?  探索人工智能在物联网领域的影响与改变  用AI升级会议体验!思必驰多款会议产品亮相全球智博会!  华为HarmonyOS 4将集|成人|工智能大型模型  AI智能室内效果图设计软件效果,确实惊到我了!  人工智能自己玩自己  IBM和NASA合作发布可追踪碳排放的开源AI基础模型  AIGC 风潮刮到游戏产业,巨人网络与阿里云达成“游戏 +AI ”合作  华为大模型登Nature正刊!审稿人:让人们重新审视预报模型的未来  30+大模型齐聚,大模型成世界人工智能大会“顶流”  人手一部「*」!视频版Midjourney免费可用,一句话秒生酷炫大片惊呆网友  张朝阳陆川谈AI:大数据模型大幅提升工作效率,ChatGPT冲击最大的是内容创作领域  读创正式上线“读创AI聊”功能  华为云天筹AI求解器荣获世界人工智能大会最高奖  当孔子遇见AI|尼山的“数字”  中兴通讯无人机高空基站助力北京门头沟受灾乡镇保障应急通信  Intel酷睿Ultra发布会官宣!迈向全新的AI时代  微软最新推出的NaturalSpeech2语音合成模型:提供更准确的语音重构,避免棒读效果  一公司推出喷火机器狗,可喷出 9 米长火焰  水路两栖艇、消防灭火机器人……这个展览“黑科技”抢眼  AI+音乐如何“生成”动听旋律?一起揭秘世界人工智能大会开场曲  创作音乐/音频的Meta开源AI工具AudioCraft,让用户通过文本提示实现  乐天派AI桌面机器人提供的正能量情绪价值直接拉满,妥妥的治愈系  RoboNeo什么时候上线  写出优质文章的妙招:利用"稿见AI助手"的实用指南  当科幻走进现实 脑机接口新技术能为生活带来哪些惊喜?  消息称苹果 iPhone 15 系列健康应用将深度融合 AI 技术  两架海燕号无人机交付中国气象局 助力建设国家级机动气象观测业务  比尔盖茨:AI确实存在风险,但可控  1分钟做出苹果Vision Pro「官网」?上班8小时搞出480个网页,同事被卷疯了  英伟达的AI领域垄断地位:一直无法撼动吗?  微盟宣布联合腾讯云共建行业大模型:加快激活AI大模型智能应用 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司