代理服务技术,是一门很古老的技术,在互联网早期出现就使用着代理技术。

一般实现代理技术的方式就是在服务器上安装代理服务软件,如ccproxysquid等,让其成为一个代理服务器,从而实现代理技术。

常用的代理技术分为正向代理、反向代理、透明代理

本文就是针对这三种代理来讲解基本原理和适用范围。

 

一、正向代理(forward Proxy)

一般情况下,如果没有特别说明,代理技术默认说的是正向代理技术

关于正向代理的概念如下: 正向代理(forward)是一个位于客户端【用户A】和原始服务器(origin server)【服务器B】之间的服务器【代理服务器Z】,为了从原始服务器取得内容,用户A向代理服务器Z发送一个请求并指定目标(服务器B),然后代理服务器Z向服务器B转交请求并将获得的内容返回给客户端。

客户端必须要进行一些特别的设置才能使用正向代理。

从上面的概念中,我们看出,文中所谓的正向代理就是访问方【用户A】通过【代理服务器Z】去访问目标服务器【服务器B】,这就是正向代理的意义所在。

【用户A】<——>【代理服务器Z】<——>【服务器B】

 

那为什么要用【代理服务器Z】去代替访问方【用户A】去访问服务器B呢?

这就要从代理服务器使用的意义说起,使用正向代理服务器作用主要有以下几点:

1、访问本无法访问的服务器B

我们抛除复杂的网络路由环境,假设上图中路由器从左到右命名为R1、R2,假设最初用户A通过互联网要访问服务器B需要经过R1和R2路由器这样一个路由节点,如果路由器R1或者路由器R2发生故障,那么就无法访问服务器B了。但是如果用户A让代理服务器Z去代替自己访问服务器B,由于代理服务器Z没有在路由器R1或R2节点中,而是通过其它的路由节点访问服务器B,那么用户A就可以得到服务器B的数据了,现实中的例子就是“翻墙”。不过自从V-B-M技术被广泛应用外,“翻墙”不但使用了传统的正向代理技术,有的还使用了V-B-M技术。

 

2、加速访问服务器B

这种说法目前不像以前那么流行了,主要是带宽流量的飞速发展。

早期的正向代理中,很多人使用正向代理就是提速。

还是如上图,假设用户A到服务器B,经过R1路由器和R2路由器,而R1到R2路由器的链路是一个低带宽链路。

而用户A到代理服务器Z,从代理服务器Z到服务器B都是高带宽链路,那么很显然就可以加速访问服务器B了。

 

3、Cache作用

Cache(缓存)技术和代理服务技术是紧密联系的(不光是正向代理,反向代理也使用了Cache(缓存)技术,例如 squid 缓存代理技术。

如上图所示,如果在用户A访问服务器B某数据J之前,已经有人通过代理服务器Z访问过服务器B上得数据J,那么代理服务器Z会把数据J保存一段时间,如果有人正好取该数据J,那么代理服务器Z不再访问服务器B,而把缓存的数据J直接发给用户A。这一技术在Cache中术语就叫Cache命中。如果有更多的像用户A的用户来访问代理服务器Z,那么这些用户都可以直接从代理服务器Z中取得数据J,而不用千里迢迢的去服务器B下载数据了。

 

4、客户端访问授权

这方面的内容现今使用的还是比较多的,例如一些公司采用ISA SERVER做为正向代理服务器来授权用户是否有权限访问互联网

防火墙作为网关,用来过滤外网对其的访问。

假设用户A和用户B都设置了代理服务器,用户A允许访问互联网,而用户B不允许访问互联网(这个在代理服务器Z上做限制)

这样用户A因为授权,可以通过代理服务器访问到服务器B,而用户B因为没有被代理服务器Z授权,所以访问服务器B时,数据包会被直接丢弃。

 

5、隐藏访问者的行踪

如下图,我们可以看出服务器B并不知道访问自己的实际是用户A,因为代理服务器Z代替用户A去直接与服务器B进行交互。

如果代理服务器Z被用户A完全控制(或不完全控制),会惯以“肉鸡”术语称呼。

 

6、小结

正向代理是一个位于客户端和原始服务器(origin server)之间的服务器,为了从原始服务器取得内容,客户端向代理发送一个请求并指定目标(原始服务器),然后代理向原始服务器转交请求并将获得的内容返回给客户端。客户端必须设置正向代理服务器,当然前提是要知道正向代理服务器的IP地址,还有代理程序的端口。

正向代理的应用场景有爬虫抓取数据,例如米扑代理就是正向代理:https://proxy.mimvp.com

 

二、反向代理(reverse proxy)

反向代理正好与正向代理相反,对于客户端而言代理服务器就像是原始web服务器,并且客户端不需要进行任何特别的设置。

客户端向反向代理的命名空间(name-space)中的内容发送普通请求,接着反向代理将判断向何处(原始web服务器)转交请求,并将获得的内容返回给客户端。 

使用反向代理服务器的作用如下:

1、保护和隐藏原始资源服务器

用户A始终认为它访问的是原始服务器B而不是代理服务器Z,但实用际上反向代理服务器Z接受用户A的请求,从原始资源服务器B中取得用户A的需求资源,然后发送给用户A。

由于防火墙的作用,只允许代理服务器Z访问原始资源服务器B。

尽管在这个虚拟的环境下,防火墙和反向代理的共同作用保护了原始资源服务器B,但用户A并不知情,会直接把方向代理服务器Z当做原始服务器。

 

2、负载均衡

当反向代理服务器不止一个的时候,我们甚至可以把它们做成集群,当更多的用户访问资源服务器B的时候,让不同的代理服务器Z(x)去应答不同的用户,然后发送不同用户需要的资源。

当然反向代理服务器像正向代理服务器一样拥有Cache的作用,它可以缓存原始资源服务器B的资源,而不是每次都要向原始资源服务器B请求数据,特别是一些静态的数据,比如图片和文件,如果这些反向代理服务器能够做到和用户X来自同一个网络,那么用户X访问反向代理服务器X,就会得到很高质量的速度,这正是CDN技术的核心。

我们并不是讲解CDN,所以去掉了CDN最关键的核心技术智能DNS。只是展示CDN技术实际上利用的正是反向代理原理这块。

反向代理结论与正向代理正好相反,对于客户端而言它就像是原始服务器,并且客户端不需要进行任何特别的设置。

基本上,网上做正反向代理的程序很多,能做正向代理的软件大部分也可以做反向代理。开源软件中最流行的就是squid,既可以做正向代理,也有很多人用来做反向代理的前端服务器。另外MS ISA也可以用来在Windows平台下做正向代理。反向代理中最主要的实践就是WEB服务,近些年来最火的就是Nginx了。网上有人说Nginx不能做正向代理,其实是不对的。Nginx也可以做正向代理,不过用的人比较少了。

 

三、透明代理(transparent proxy)

如果把正向代理、反向代理、透明代理按照人类血缘关系来划分的话。

那么正向代理和透明代理是很明显堂亲关系,而正向代理和反向代理就是表亲关系了 。

透明代理的意思是客户端根本不需要知道有代理服务器的存在,它改编你的request fields(报文),并会传送真实IP。

注意,加密的透明代理则是属于匿名代理,意思是不用设置使用代理了。 

透明代理实践的例子就是时下很多公司使用的行为管理软件。

用户A和用户B并不知道行为管理设备充当透明代理行为,当用户A或用户B向服务器A或服务器B提交请求的时候,透明代理设备根据自身策略拦截并修改用户A或B的报文,并作为实际的请求方,向服务器A或B发送请求,当接收信息回传,透明代理再根据自身的设置把允许的报文发回至用户A或B,如上图,如果透明代理设置不允许访问服务器B,那么用户A或者用户B就不会得到服务器B的数据。

 

四、透明、匿名、高匿的正向代理

高匿、匿名、透明,都是正向代理,是针对隐藏用户请求数据而言,例如:隐藏IP地址,隐藏浏览器参数,Cookie等

对于一般的访问网络,一共有五种方式:无代理、透明、普通匿名、欺骗匿名、高匿(Elite)

五种方式及判断原理如下:

1、无代理

REMOTE_ADDR = 您的真实IP
HTTP_VIA = 没数值或不显示
HTTP_X_FORWARDED_FOR = 没数值或不显示

2、透明代理

REMOTE_ADDR = 最后一个代理服务器IP
HTTP_VIA = 代理服务器IP
HTTP_X_FORWARDED_FOR = 您的真实IP,经过多个代理服务器时,这个值类似:123.57.78.101, 120.24.177.48, 47.88.76.11

3、匿名代理

REMOTE_ADDR = 最后一个代理服务器IP
HTTP_VIA = 代理服务器IP
HTTP_X_FORWARDED_FOR = 代理服务器IP,经过多个代理服务器时,这个值类似:123.57.78.101, 120.24.177.48, 47.88.76.11

4、欺骗代理

REMOTE_ADDR = 最后一个代理服务器IP
HTTP_VIA = 代理服务器IP
HTTP_X_FORWARDED_FOR = 随机的IP,经过多个代理服务器时,这个值类似:123.57.78.101, 120.24.177.48, 47.88.76.11

5、高匿代理

REMOTE_ADDR = 代理服务器IP
HTTP_VIA = 没数值或不显示
HTTP_X_FORWARDED_FOR = 没数值或不显示

 

正向代理,请参见米扑代理https://proxy.mimvp.com

米扑代理,支持 http、https、socks4、socks5等代理,100%高匿,99%可用,可免费试用5小时

 

 

参考推荐

Nginx 反向代理及示例

Nginx 负载均衡方案详解

后台服务器开发总结

Apache 和 Nginx 对比

Apache、Nginx、Tomcat 区别