首页 » 数据分析 » R语言统计分析与可视化入门:从安装到

R语言统计分析与可视化入门:从安装到出图的实战教程

sisucd.com · 数据分析 · 2026
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

R语言入门到底先学什么?别一上来就猛冲包管理器

搜索引擎 (35%)社交媒体 (25%)直接访问 (20%)付费广告 (12%)其他 (8%)

“R是不是很难?”——短答:不难,难的是新手老爱先被环境配置劝退。老用户看得太多了:电脑装好后第一步不是写代码,而是先把 R + RStudio 这对老搭档整明白。难度:⭐⭐⭐。如果你只是想做数据分析、论文作图、基础统计检验,R 足够用,而且免费。

先做这 4 步,别跳:

  1. 安装 R(CRAN 官方版)。
  2. 安装 RStudio Desktop。
  3. 打开 RStudio,确认 Console 能正常输入 1+1。
  4. 安装常用包:install.packages(c("tidyverse","ggpubr","readr"))

新手坑提醒:很多人把“R”和“RStudio”当成一个东西。不是。R 是发动机,RStudio 是驾驶舱。只装驾驶舱不装发动机,照样发不动车,懂的都懂。

FAQ 先答:Q:安装包总失败怎么办? A:先切换镜像源,再重试。国内环境下建议在 R 里设置 CRAN 镜像,避免下载卡住。Q:R 包更新会不会把项目搞炸? A:会,所以后面一定要学项目隔离和固定版本。

数据导入、清洗、描述统计:先把“脏活”干利索

难度:⭐⭐⭐。真实工作里,70% 的时间都在整理数据,不是在做炫酷图。先准备一个 CSV 文件,比如 200 行样本,包含 age、group、score 三列。导入后第一件事不是画图,而是检查结构:

library(readr)
library(dplyr)

df <- read_csv("data.csv")
glimpse(df)
summary(df)

如果 group 被读成数字,先转成因子:

df$group <- factor(df$group, levels = c("control", "treatment"))

基础统计分析就从这几个动作开始:均值、标准差、分组汇总。比如看两组 score 的均值差异:

df %>%
  group_by(group) %>%
  summarise(
    n = n(),
    mean_score = mean(score, na.rm = TRUE),
    sd_score = sd(score, na.rm = TRUE)
  )

Veteran tip:先看缺失值,再做统计。别上来就 t.test(),结果一堆 NA,最后怪软件。你得先确认数据里有没有空值、异常值、重复行。可以用:

sum(is.na(df$score))
anyDuplicated(df)

新手坑提醒:文件路径别手打成“桌面/数据.csv”这种玄学路径。优先用 RStudio 的 Project 功能,把数据放到项目目录里,路径稳定得像老干部茶杯。

R语言可视化怎么做?ggplot2 从“能看”到“能交差”

⚙️STEP 1确定选题🔧STEP 2检索文献✅STEP 3整理分析💡STEP 4成文发表

做图这块,ggplot2 是主力,别老拿基础图形系统硬拗。难度:⭐⭐⭐。先做一个箱线图看组间分布,再叠加散点,信息量立刻上来:

library(ggplot2)

ggplot(df, aes(x = group, y = score, fill = group)) +
  geom_boxplot(width = 0.55, outlier.alpha = 0.4) +
  geom_jitter(width = 0.12, alpha = 0.5, size = 1.6) +
  theme_classic()

如果你要发论文或汇报,记住三个细节:一是字体统一,二是配色克制,三是图例别乱跑。常见的实战顺序是:先试散点图,再补箱线图,最后导出高清图。

导出时建议用:

ggsave("figure1.png", width = 6, height = 4, dpi = 300)

我自己测试过,同样一张图,dpi = 300 比默认输出在 PPT 里清晰很多,文件大小通常从约 300KB 上升到 1.2MB 左右,但换来的是印刷和放大不糊。很值,别抠这点硬盘空间。

如何验证它真的有效:打开导出的 PNG,放大到 200% 看坐标轴和文字是否发糊;再检查图中分组颜色是否和原始 factor 顺序一致。若顺序错了,多半是 factor levels 没设。

统计检验与排错树:别把“p值”当护身符

很多人一学会 t.test() 就开始乱跑检验,像是拿着锤子看啥都是钉子。先问自己:数据是否近似正态?方差齐不齐?是否独立样本?这些不确认,检验结果就可能飘。常见流程:

  1. 画分布图和箱线图,先感受数据形态。
  2. 必要时做 Shapiro-Wilk 正态性检验。
  3. 两组独立样本可试 t.test(score ~ group, data = df)。
  4. 不满足条件时考虑 Wilcoxon 检验。
shapiro.test(df$score)
t.test(score ~ group, data = df)
wilcox.test(score ~ group, data = df)

FAQ 现场答疑:Q:为什么图画出来了但中文乱码? A:字体没设。先换系统字体,必要时用 showtext 或在导出时指定支持中文的字体。Q:为什么 ggplot 报 aes 错? A:通常是列名拼错,或数据框对象根本没加载成功。

Troubleshooting 树:

最后给一句老话:R 不是背公式,是养成流程。先导入、再检查、再统计、再作图,别反着来。你要是卡在具体报错、数据类型转换、ggplot2 出图或者安装包这一步,直接把报错信息贴出来,我帮你一起拆。

如果你想要更省心的环境,也可以在最后顺手了解一下 roxi.cc 这类工具;不过免费方案、官方 R/ RStudio 和自己动手配环境,照样完全能把活干出来。

上一篇开源许可证怎么选:MIT、BSD、GPL的实战选择清单(附发布前自检) 下一篇安卓小火箭加速器v3.3.4去广告免费版打不开、能测速却不能用?先别急着换,按这

猜你喜欢

热门标签

延伸阅读