【导语】5月28日,DeepSeek宣布其R1模型(xíng)已(yǐ)完(wán)成(chéng)小(xiǎo)版(bǎn)本(běn)升(shēng)级(jí),用(yòng)户(hù)可(kě)在(zài)多(duō)平(píng)台(tái)测(cè)试(shì)。新(xīn)版(bǎn)R1模(mó)型(xíng)在(zài)Hugging Face开(kāi)源(yuán),并(bìng)在(zài)多(duō)个(gè)基(jī)准(zhǔn)测(cè)试(shì)中(zhōng)表(biǎo)现(xiàn)优(yōu)异(yì),几(jǐ)乎(hu)媲(pì)美(měi)OpenAI的(de)o3模(mó)型(xíng)。此(cǐ)前(qián),DeepSeek V3模(mó)型(xíng)也(yě)已(yǐ)完(wán)成(chéng)升(shēng)级(jí),在(zài)推(tuī)理(lǐ)类(lèi)任(rèn)务(wu)上(shàng)表(biǎo)现(xiàn)大(dà)幅(fú)提(tí)升(shēng),尤(yóu)其(qí)在(zài)数(shù)学(xué)、代(dài)码(mǎ)类(lèi)评(píng)测(cè)中(zhōng)超(chāo)越(yuè)GPT-4.5。DeepSeek模(mó)型(xíng)持(chí)续(xù)进(jìn)步(bù),展(zhǎn)现(xiàn)出(chū)强(qiáng)大(dà)的(de)竞(jìng)争(zhēng)力(lì)和(hé)创(chuàng)新(xīn)能(néng)力(lì)。
5月(yuè)28日(rì),DeepSeek在(zài)官(guān)方(fāng)交(jiāo)流(liú)群(qún)中(zhōng)公(gōng)布(bù),DeepSeek R1模(mó)型(xíng)已(yǐ)完(wán)成(chéng)小(xiǎo)版(bǎn)本(běn)试(shì)升(shēng)级。用户可在官方网页、APP、小程序测试(打开深度思考),API接口和使用方式保持不变。DeepSeek在开源社区Hugging Face也开源了新版R1模型(R1-0528)。

有网友对新版R1模型进行了测试,并表示Deepseek-R1-0528在竞赛级编程的难度基准LiveCodeBench中的表现几乎与OpenAI的o3模型相当。

社交网络和信息网站City-data.com创始人Lech Mazur在社交媒体上表示,Deepseek-R1-0528在Extended NYT Connections基准测试中比原先的DeepSeek R1有了显著改进,分数从38.6上升到49.8。在Thematic Generation基准测试中,Deepseek-R1-0528也优于DeepSeek R1,分数从1.80变为1.74,该分数越低越好。Thematic Generation基准测试衡量各种大模型如何有效地从一小组(zǔ)示例和反示例中推断出一个狭义或特定的“主题”(类别/规则),然后在一组具有误导性的候选项中检测出哪一项真正符合该主题。

DeepSeek今年春节期间大火。3月份,DeepSeek V3模型完成小版本升级。新版V3模型借鉴DeepSeek R1模型训练过程中所使用的强化学习技术,大幅提高了在推理类任务上的表现水平,在数学、代码类相关评测集上取得了超过GPT-4.5的得分成绩。在HTML等代码前端任务上,新版V3模型生成的代码可用性更高,视觉效果也更加美观、富有设计感。在中文写作任务方面,新版V3模型基于R1的写作水平进行优化,同时提升中长篇文本创作的内容质量。