rsync指令的使用与算法解析 - 每周指令

rsync命令是一个远程数据同步工具,可通过LAN/WAN快速同步多台主机间的文件。rsync使用所谓的rsync算法来使本地和远程两个主机之间的文件达到同步,这个算法只传送两个文件的不同部分,而不是每次都整份传送,因此速度相当快。 rsync是一个功能非常强大的工具,其命令也有很多功能特色选项,我们下面就对它的选项一一进行分析说明。

一、参数解析

-v, --verbose 详细模式输出。
-q, --quiet 精简输出模式。
-c, --checksum 打开校验开关,强制对文件传输进行校验。
-a, --archive 归档模式,表示以递归方式传输文件,并保持所有文件属性,等于-rlptgoD。
-r, --recursive 对子目录以递归模式处理。
-R, --relative 使用相对路径信息。
-b, --backup 创建备份,也就是对于目的已经存在有同样的文件名时,将老的文件重新命名为~filename。可以使用--suffix选项来指定不同的备份文件前缀。
--backup-dir 将备份文件(如~filename)存放在在目录下。
-suffix=SUFFIX 定义备份文件前缀。
-u, --update 仅仅进行更新,也就是跳过所有已经存在于DST,并且文件时间晚于要备份的文件,不覆盖更新的文件。
-l, --links 保留软链结。
-L, --copy-links 想对待常规文件一样处理软链结。
--copy-unsafe-links 仅仅拷贝指向SRC路径目录树以外的链结。
--safe-links 忽略指向SRC路径目录树以外的链结。
-H, --hard-links 保留硬链结。
-p, --perms 保持文件权限。
-o, --owner 保持文件属主信息。
-g, --group 保持文件属组信息。
-D, --devices 保持设备文件信息。
-t, --times 保持文件时间信息。
-S, --sparse 对稀疏文件进行特殊处理以节省DST的空间。
-n, --dry-run现实哪些文件将被传输。
-w, --whole-file 拷贝文件,不进行增量检测。
-x, --one-file-system 不要跨越文件系统边界。
-B, --block-size=SIZE 检验算法使用的块尺寸,默认是700字节。
-e, --rsh=command 指定使用rsh、ssh方式进行数据同步。
--rsync-path=PATH 指定远程服务器上的rsync命令所在路径信息。
-C, --cvs-exclude 使用和CVS一样的方法自动忽略文件,用来排除那些不希望传输的文件。
--existing 仅仅更新那些已经存在于DST的文件,而不备份那些新创建的文件。
--delete 删除那些DST中SRC没有的文件。
--delete-excluded 同样删除接收端那些被该选项指定排除的文件。
--delete-after 传输结束以后再删除。
--ignore-errors 及时出现IO错误也进行删除。
--max-delete=NUM 最多删除NUM个文件。
--partial 保留那些因故没有完全传输的文件,以是加快随后的再次传输。
--force 强制删除目录,即使不为空。
--numeric-ids 不将数字的用户和组id匹配为用户名和组名。
--timeout=time ip超时时间,单位为秒。
-I, --ignore-times 不跳过那些有同样的时间和长度的文件。
--size-only 当决定是否要备份文件时,仅仅察看文件大小而不考虑文件时间。
--modify-window=NUM 决定文件是否时间相同时使用的时间戳窗口,默认为0。
-T --temp-dir=DIR 在DIR中创建临时文件。
--compare-dest=DIR 同样比较DIR中的文件来决定是否需要备份。
-P 等同于 --partial。
--progress 显示备份过程。
-z, --compress 对备份的文件在传输时进行压缩处理。
--exclude=PATTERN 指定排除不需要传输的文件模式。
--include=PATTERN 指定不排除而需要传输的文件模式。
--exclude-from=FILE 排除FILE中指定模式的文件。
--include-from=FILE 不排除FILE指定模式匹配的文件。
--version 打印版本信息。
--address 绑定到特定的地址。
--config=FILE 指定其他的配置文件,不使用默认的rsyncd.conf文件。
--port=PORT 指定其他的rsync服务端口。
--blocking-io 对远程shell使用阻塞IO。
-stats 给出某些文件的传输状态。
--progress 在传输时现实传输过程。
--log-format=formAT 指定日志文件格式。
--password-file=FILE 从FILE中得到密码,格式为文件中单行写入密码
--bwlimit=KBPS 限制I/O带宽,KBytes per second。
-h, --help 显示帮助信息。

二、工作模式

rsync六种不同的工作模式,详细介绍如下:

  • 拷贝本地文件

    • 规则:当SRCDES路径信息都不包含有单个冒号:分隔符时就启动该模式;
    • 语法rsync [OPTION]... SRC DEST
    • 示例``:rsync -a /data /backup`;
  • 将本地机器的内容拷贝到远程机器

    • 规则:当DST路径地址包含单个冒号:分隔符时启动该模式;
    • 语法rsync [OPTION]... SRC [USER@]host:DEST
    • 示例rsync -avz *.c foo:src
  • 将远程机器的内容拷贝到本地机器

    • 规则:当SRC地址路径包含单个冒号:分隔符时启动该模式;
    • 语法rsync [OPTION]... [USER@]HOST:SRC DEST
    • 示例rsync -avz foo:src/bar /data
  • 从远程rsync服务器中拷贝文件到本地机

    • 规则:当SRC路径信息包含::分隔符时启动该模式;
    • 语法rsync [OPTION]... [USER@]HOST::SRC DEST
    • 示例rsync -av root@192.168.78.192::www /databack
  • 从本地机器拷贝文件到远程rsync服务器

    • 规则:当DST路径信息包含::分隔符时启动该模式;
    • 语法rsync [OPTION]... SRC [USER@]HOST::DEST
    • 示例rsync -av /databack root@192.168.78.192::www
  • 列出远程机的文件列表

    • 规则:命令中省略掉本地机信息;
    • 语法rsync [OPTION]... rsync://[USER@]HOST[:PORT]/SRC [DEST]
    • 示例rsync -v rsync://192.168.78.192/www

三、rsync的算法解析

3.1、分块checksum算法

首先,我们会把 DST文件 的文件均切分成若干小块,例如每块大小为512个字节(最后一块会小于这个数),然后对每块计算两个checksum,计算checksum使用的算法如下:

  • rolling checksum(轮替校验和):这是一种弱checksum,会产生32位的checksum,使用的是Mark Adler发明的adler-32算法,用来快速弱检验是否相同;
  • 强checksum:会产生128位的checksum,之前使用的是md4,现在使用的md5 hash算法,用来精准校验是否相同;

checksum校验

3.2、传输算法

同步目标端会把DST文件的的一个checksum列表传给同步源,这个列表里包括了三个东西:

  • rolling checksum(32bits)
  • md5 checksum(128bits)
  • 文件块编号

3.3、checksum查找算法

同步源端拿到DST文件checksum数组后,会把这个数据存到一个hash table中,用rolling checksumhash,以便获得O(1)时间复杂度的查找性能,hash表大小为16bits的,因此hash表槽位为2的16次方,同时使用链表来解决碰撞冲突。

DST文件块checksum组成的hash表

3.4、比对算法

  • SRC文件第一个文件块(假设文件块大小为512),也就是从SRC文件的第1个字节到第512个字节,取出来后做rolling checksum计算,在hash表中查找计算好的值:
    • 找到对应的checksum
      • 由于rolling checksum是一个弱checksum,因为尝试比较md5checksum,经过两次的checksum比较,最终仍旧发生冲突的概率为1/(2^160),这种冲突概率太小,忽略不计;
      • 在比较md5checksum后,如果可以找到对应的匹配项,则表示在SRC文件DST文件中有相同的文件块;
    • 未找到对应的checksum:只要rolling checksummd5 checksum 其中有一个在DST文件checksum hash表中找不到匹配项,那么就会触发算法对SRC文件rolling动作,比对算法会住后移动1个字节,对SRC文件的字节位置为2-513的文件块要做checksum (需要特别注意:这里在原有checksum的基础上进行调整就可以得出新的checksum,而不必重新计算checksum,这也是rolling的精髓);

数据比对

最终,在同步源这端,我们的rsync算法可能会得到下面这个样子的一个数据数组,图中,红色块表示在目标端已匹配上,不用传输(注:图中存在两块Chunk #5指的是两个文件块在计算checksum的时候存在hash冲突,使用了链表进行解决),而白色的地方就是需要传输的内容(注意:这些白色的块是不定长的),这样,同步源这端把这个数组(白色的就是实际内容,红色的就放一个标号)压缩传到目的端,在目的端的rsync会根据这个表重新生成文件,这样,同步完成。

数据比对后

3.5、补充文档

参考文档:https://coolshell.cn/articles/7425.html

作者: bugwz
链接: https://bugwz.com/2019/10/20/command-rsync/
声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 咕咕